Перейти к содержимому
VinumExMachina Атлас ИИ в вине
Выберите язык: English

АтласБенчмарки

OenoBench

Раздел § 3.1
Статус опубликовано
Обновлено
Языки EN · RU
Объём 84 зн. · 3 мин
Лидерборд Полный рейтинг и то, что за ним стоит: откуда у каждой конфигурации её точность, что добавляет режим рассуждения и сколько стоит правильный ответ. 16 конфигураций · 3 266 вопросов

OenoBench задаёт 16 конфигурациям больших языковых моделей 3 266 вопросов о вине с выбором ответа — виноградарство, виноделие, винный бизнес, винные регионы, сорта винограда, производители, на уровнях сложности, откалиброванных по лестнице WSET / Court of Master Sommeliers. Первый релиз показывает фронтир, передний край моделей, который почти выучил вино на память, но так и не научился о нём рассуждать: стоит вопросу перестать быть проверкой памяти, и каждая конфигурация теряет от 26,6 до 39,6 процентного пункта точности.

Первую строку релиза держит o3 с 83,6%, но порядок наверху решает меньше, чем кажется по рейтингу: шесть конфигураций умещаются в полосу шириной 2,6 процентного пункта. Выбор между ними — вопрос цены, и решается он в анализе стоимости на лидерборде, а не в этой колонке.

Падение там, где память перестаёт помогать, — единственный результат прогона, у которого нет исключений: доверительный интервал не включает ноль у всех 16 из 16 конфигураций. Причём запоминание наверху уже почти исчерпано: 5 конфигураций отвечают на closed-book-вопросы — те, что берутся из одной памяти, — с точностью 97% и выше, и те же конфигурации дают от 65,2% до 70,3% там, где ответ нужно вывести из приложенного контекста. Трудная часть вина для этих моделей — уже не запоминание.

Винный бизнес — худший домен для каждой конфигурации прогона, у всех 16 из 16: в среднем 56,5% против 79,4% на производителях — лучшем домене для 15 из них. Кто делает вино, модели знают заметно лучше, чем то, как вино продаётся, — и это, скорее всего, честный портрет прочитанного: о производителях пишут постоянно, о марже торговли — почти никогда. Слепое пятно, иными словами, — торговля.

Из 4 пар прогона — одна и та же базовая модель со включённым режимом рассуждения и без — интервал уходит от нуля у 1 пары: DeepSeek-R1 против DeepSeek-V3, прибавка 6,8 процентного пункта при базе 70,3%. Ещё 3 фронтирные пары не дают ничего, а у пары Claude Opus 4.7 разница — ровно −0,1pp. Режим рассуждения чинит ошибки, которые базовая модель ещё делает; на верхних строчках рейтинга их почти не осталось. Доплата за расширенное рассуждение — не апгрейд, а ремонт.

Прогон мерит и собственных экзаменаторов. Почти каждый вопрос написан одним из пяти семейств моделей (остальные — детерминированными шаблонами), поэтому конфигурацию можно проверить на вопросах её собственного семейства против чужих — и разрыв идёт по лабораториям. Все конфигурации Anthropic отвечают на вопросы своего семейства лучше — Claude Haiku 4.5 на 10,0 процентного пункта, к ним примыкает Qwen 2.5 7B; все конфигурации Google на своих, наоборот, теряют — Gemini 2.5 Flash на 10,4 процентного пункта; у OpenAI перекоса нет. Интервал исключает ноль у 7 из 13 конфигураций, у которых это измерялось: судьи, не умеющие быть нейтральными к авторству ни в ту, ни в другую сторону, — и именно поэтому вопросы здесь не пишет какое-то одно семейство.

Релиз

Вопросы 3 266 с выбором ответа
Домены 6 виноградарство … производители
Уровни сложности 4 лестница WSET / CMS
Конфигурации 16 фронтирные и open-source
Прогоны вопросов 52 256 этот релиз
Релиз v2026-05-04 версионированный JSON

Как процитировать

Обе формы ссылаются на датированный файл прогона — после публикации он уже не меняется.

Nikita Khudov. OenoBench: a wine-knowledge benchmark for large language models, v2026-05-04 (2026). https://vinumexmachina.com/oenobench/oenobench-v2026-05-04.json. CC BY-SA 4.0.

@misc{khudov-oenobench-v2026-05-04,
  author  = {Nikita Khudov},
  title   = {OenoBench: a wine-knowledge benchmark for large language models},
  version = {v2026-05-04},
  year    = {2026},
  url     = {https://vinumexmachina.com/oenobench/oenobench-v2026-05-04.json},
  note    = {CC BY-SA 4.0}
}

Как собирается корпус вопросов

01

Сбор данных

Материал собирается по всем шести доменам, и заранее оговорено, какую долю корпуса может занять каждый поддомен, — чтобы Бургундия не вытеснила Бароссу, а каждый факт вёл к внешнему авторитетному источнику.

автоматически
02

Многомодельная генерация

Пять семейств моделей — Claude, GPT, Gemini, Llama, Qwen — плюс детерминированные шаблоны пишут вопросы-кандидаты, так что ни одно семейство не сочиняет непропорциональную долю вопросов, по которым его потом будут оценивать. Измеренное обоснование — разрыв самопредпочтения выше.

автоматически
03

ИИ-валидация

Аудит девятью агентами проверяет каждый вопрос-кандидат: верен ли факт, подходит ли ровно один вариант, соблазняют ли неверные варианты того, кто знает предмет наполовину, не выдаёт ли формулировка ответ, не спрашивают ли слишком часто про одну страну и не списана ли фраза дословно из источника. Не прошедшие вопросы отбрасываются или переписываются.

автоматически
04

Проверка человеком

Человек выборочно проверяет вопросы в каждом домене и на каждом уровне, разрешает разногласия автоматических проверок и подписывает релиз.

с участием человека

Что показывает лидерборд

Общая точность
Одно число, и самое неинтересное.
1
По доменам
Точность внутри каждого домена.
6
По уровням сложности
Точность на каждой ступени лестницы WSET / CMS.
4
Closed-book против контекста
Ответ берётся из параметрической памяти — или его нужно вывести из приложенного контекста?
2
Прирост от рассуждений
Одна и та же базовая модель с режимом рассуждения и без.
Δ
Самопредпочтение
Точность модели на вопросах своего семейства против чужих. Вынесено отдельно: это свойство устройства самого бенчмарка, а не модели.
Δ

Примечание

  • Полная научная статья находится на этапе ревью и доработки; будет опубликована в сентябре 2026 года.
  • Датасет будет выложен в открытый доступ в момент публикации статьи.