Атлас/Бенчмарки
OenoBench
OenoBench задаёт 16 конфигурациям больших языковых моделей 3 266 вопросов о вине с выбором ответа — виноградарство, виноделие, винный бизнес, винные регионы, сорта винограда, производители, на уровнях сложности, откалиброванных по лестнице WSET / Court of Master Sommeliers. Первый релиз показывает фронтир, передний край моделей, который почти выучил вино на память, но так и не научился о нём рассуждать: стоит вопросу перестать быть проверкой памяти, и каждая конфигурация теряет от 26,6 до 39,6 процентного пункта точности.
Первую строку релиза держит o3 с 83,6%, но порядок наверху решает меньше, чем кажется по рейтингу: шесть конфигураций умещаются в полосу шириной 2,6 процентного пункта. Выбор между ними — вопрос цены, и решается он в анализе стоимости на лидерборде, а не в этой колонке.
Падение там, где память перестаёт помогать, — единственный результат прогона, у которого нет исключений: доверительный интервал не включает ноль у всех 16 из 16 конфигураций. Причём запоминание наверху уже почти исчерпано: 5 конфигураций отвечают на closed-book-вопросы — те, что берутся из одной памяти, — с точностью 97% и выше, и те же конфигурации дают от 65,2% до 70,3% там, где ответ нужно вывести из приложенного контекста. Трудная часть вина для этих моделей — уже не запоминание.
Винный бизнес — худший домен для каждой конфигурации прогона, у всех 16 из 16: в среднем 56,5% против 79,4% на производителях — лучшем домене для 15 из них. Кто делает вино, модели знают заметно лучше, чем то, как вино продаётся, — и это, скорее всего, честный портрет прочитанного: о производителях пишут постоянно, о марже торговли — почти никогда. Слепое пятно, иными словами, — торговля.
Из 4 пар прогона — одна и та же базовая модель со включённым режимом рассуждения и без — интервал уходит от нуля у 1 пары: DeepSeek-R1 против DeepSeek-V3, прибавка 6,8 процентного пункта при базе 70,3%. Ещё 3 фронтирные пары не дают ничего, а у пары Claude Opus 4.7 разница — ровно −0,1pp. Режим рассуждения чинит ошибки, которые базовая модель ещё делает; на верхних строчках рейтинга их почти не осталось. Доплата за расширенное рассуждение — не апгрейд, а ремонт.
Прогон мерит и собственных экзаменаторов. Почти каждый вопрос написан одним из пяти семейств моделей (остальные — детерминированными шаблонами), поэтому конфигурацию можно проверить на вопросах её собственного семейства против чужих — и разрыв идёт по лабораториям. Все конфигурации Anthropic отвечают на вопросы своего семейства лучше — Claude Haiku 4.5 на 10,0 процентного пункта, к ним примыкает Qwen 2.5 7B; все конфигурации Google на своих, наоборот, теряют — Gemini 2.5 Flash на 10,4 процентного пункта; у OpenAI перекоса нет. Интервал исключает ноль у 7 из 13 конфигураций, у которых это измерялось: судьи, не умеющие быть нейтральными к авторству ни в ту, ни в другую сторону, — и именно поэтому вопросы здесь не пишет какое-то одно семейство.
Релиз
Как процитировать
Обе формы ссылаются на датированный файл прогона — после публикации он уже не меняется.
Nikita Khudov. OenoBench: a wine-knowledge benchmark for large language models, v2026-05-04 (2026). https://vinumexmachina.com/oenobench/oenobench-v2026-05-04.json. CC BY-SA 4.0.
@misc{khudov-oenobench-v2026-05-04,
author = {Nikita Khudov},
title = {OenoBench: a wine-knowledge benchmark for large language models},
version = {v2026-05-04},
year = {2026},
url = {https://vinumexmachina.com/oenobench/oenobench-v2026-05-04.json},
note = {CC BY-SA 4.0}
} Как собирается корпус вопросов
Сбор данных
Материал собирается по всем шести доменам, и заранее оговорено, какую долю корпуса может занять каждый поддомен, — чтобы Бургундия не вытеснила Бароссу, а каждый факт вёл к внешнему авторитетному источнику.
автоматическиМногомодельная генерация
Пять семейств моделей — Claude, GPT, Gemini, Llama, Qwen — плюс детерминированные шаблоны пишут вопросы-кандидаты, так что ни одно семейство не сочиняет непропорциональную долю вопросов, по которым его потом будут оценивать. Измеренное обоснование — разрыв самопредпочтения выше.
автоматическиИИ-валидация
Аудит девятью агентами проверяет каждый вопрос-кандидат: верен ли факт, подходит ли ровно один вариант, соблазняют ли неверные варианты того, кто знает предмет наполовину, не выдаёт ли формулировка ответ, не спрашивают ли слишком часто про одну страну и не списана ли фраза дословно из источника. Не прошедшие вопросы отбрасываются или переписываются.
автоматическиПроверка человеком
Человек выборочно проверяет вопросы в каждом домене и на каждом уровне, разрешает разногласия автоматических проверок и подписывает релиз.
с участием человекаЧто показывает лидерборд
- Общая точность
- Одно число, и самое неинтересное.
- 1
- По доменам
- Точность внутри каждого домена.
- 6
- По уровням сложности
- Точность на каждой ступени лестницы WSET / CMS.
- 4
- Closed-book против контекста
- Ответ берётся из параметрической памяти — или его нужно вывести из приложенного контекста?
- 2
- Прирост от рассуждений
- Одна и та же базовая модель с режимом рассуждения и без.
- Δ
- Самопредпочтение
- Точность модели на вопросах своего семейства против чужих. Вынесено отдельно: это свойство устройства самого бенчмарка, а не модели.
- Δ
Примечание
- Полная научная статья находится на этапе ревью и доработки; будет опубликована в сентябре 2026 года.
- Датасет будет выложен в открытый доступ в момент публикации статьи.