Перейти к содержимому
VinumExMachina Атлас ИИ в вине
Выберите язык: English

Бенчмарки

Лидерборд OenoBench

Между первой строкой лидерборда и последней — 30,3 процентного пункта на одних и тех же 3 266 вопросах с выбором ответа: o3 — 83,6%, Claude Haiku 4.5 — 53,3%. Нижняя строка любопытна и сама по себе: последнее место занимает малая модель одной из передовых лабораторий, и открытая Llama на 8 миллиардов параметров обходит её на 7,2 процентного пункта. Фильтры режут рейтинг по домену, по уровню сложности и по признаку closed-book / контекст; остальные вкладки — прирост от рассуждений, самопредпочтение и цена правильного ответа — посчитаны из того же прогона 16 конфигураций.

Рис.02
Рис. 02Где прибор проседаетпоказание 1 из 3 · o3 · два режима · n 1 601 / 1 665

Ступенчатая диаграмма. Корпус упорядочен по closed-book разбиению: сначала идут вопросы, отвечаемые из параметрических знаний (1 601), затем — требующие контекстного рассуждения (1 665). Перо держит 0,974 в первом режиме и 0,703 во втором — падение 0,271 у o3 — внутри полосы ±1 биномиальной стандартной ошибки, 0,0159 и 0,0457, при опорном окне 100. Штриховые линии — среднее по всем конфигурациям (16): 0,896 и 0,570, падение 0,326. Точность — от 0,30 до 1,00. Перо рисует ступень, а не скользящее среднее: прогон публикует агрегаты по режимам, а не результаты по отдельным вопросам.

Δ 0,2710,300,400,500,600,700,800,901,0001 0001 6012 0003 0003 266CLOSED-BOOK (ПАРАМЕТРИЧЕСКИЕ) · n 1 601КОНТЕКСТНОЕ РАССУЖДЕНИЕ · n 1 6650,9740,7030,8960,570ось: точность · абсцисса: корпус в порядке closed-book
±1 SE, биномиальная, при опорном окне 100среднее по всем конфигурациям (16)сплошное перо: o3 · OpenAI · effort
Вывод 1. Каждая конфигурация проседает на вопросах, требующих рассуждения, а не припоминания. o3 теряет 0,271; среднее по всем конфигурациям (16) — 0,326. Полоса шума расширяется вместе с падением: контекстный режим измеряется менее точно при том же опорном окне. Перо рисует ступень, а не скользящее среднее: прогон публикует агрегаты по режимам, а не результаты по отдельным вопросам.
Рис.03
Рис. 03Разрыв не сокращается с рангомвсе конфигурации (16) · по общей точности

Диаграмма «гантели». Конфигурации (16) упорядочены по общей точности, от первой к последней, каждая занимает одну строку. Отрезок соединяет точность на вопросах, требующих контекстного рассуждения (n 1 665), с точностью на closed-book вопросах (n 1 601) по шкале от 0,30 до 1,00; падение между ними напечатано справа. Наименьшее падение — у GPT-5, 0,266; наибольшее — у DeepSeek-V3, 0,396. Лидер по общей точности — o3.

0,300,400,500,600,700,800,901,00ТОЧНОСТЬΔ ПАДЕНИЕКОНФИГУРАЦИЯo30,271GPT-50,266Gemini 2.5 Pro (thinking)0,290Gemini 2.5 Pro0,300Claude Opus 4.70,319Claude Opus 4.7 (thinking)0,323GPT-5 mini0,319DeepSeek-R10,337Gemini 2.5 Flash0,343DeepSeek-V30,396Mistral Large 24110,358Qwen 2.5 72B0,381Llama 3.3 70B0,364Llama 3.1 8B0,304Qwen 2.5 7B0,311Claude Haiku 4.50,331
Closed-book (параметрические) · n 1 601Контекстное рассуждение · n 1 665
От первого места к последнему длина отрезка почти не меняется. Наименьший разрыв — у GPT-5 (0,266), наибольший — у DeepSeek-V3 (0,396).
OenoBench · v2026-05-0416 конфигураций моделей · 3 266 вопросов в шести винных доменах
Домен
Сложность
Closed-book vs контекст
МодельТочность
  1. 1
    o3OpenAIeffort
    83,6%
  2. 2
    GPT-5OpenAI
    82,8%
  3. 3
    Gemini 2.5 Pro (thinking)Googlethinking
    82,6%
  4. 4
    Gemini 2.5 ProGoogle
    81,7%
  5. 5
    Claude Opus 4.7Anthropic
    81,0%
  6. 6
    Claude Opus 4.7 (thinking)Anthropicthinking
    81,0%
  7. 7
    GPT-5 miniOpenAI
    78,4%
  8. 8
    DeepSeek-R1DeepSeekthinking
    77,1%
  9. 9
    Gemini 2.5 FlashGoogle
    75,1%
  10. 10
    DeepSeek-V3DeepSeek
    70,3%
  11. 11
    Mistral Large 2411Mistral AI
    69,1%
  12. 12
    Qwen 2.5 72BAlibaba
    67,4%
  13. 13
    Llama 3.3 70BMeta
    67,1%
  14. 14
    Llama 3.1 8BMeta
    60,5%
  15. 15
    Qwen 2.5 7BAlibaba
    57,0%
  16. 16
    Claude Haiku 4.5Anthropic
    53,3%

Все цифры выше берутся из одного версионированного файла прогона, опубликованного под лицензией CC BY-SA 4.0: скачать полные результаты (JSON, 23 КБ). Файлы прогонов накапливаются, а не перезаписываются, поэтому эта ссылка продолжит работать и после публикации следующих прогонов — ссылайтесь на датированный файл, а не на страницу лидерборда.

Лидерборд обновлён