Лидерборд OenoBench
Между первой строкой лидерборда и последней — 30,3 процентного пункта на одних и тех же 3 266 вопросах с выбором ответа: o3 — 83,6%, Claude Haiku 4.5 — 53,3%. Нижняя строка любопытна и сама по себе: последнее место занимает малая модель одной из передовых лабораторий, и открытая Llama на 8 миллиардов параметров обходит её на 7,2 процентного пункта. Фильтры режут рейтинг по домену, по уровню сложности и по признаку closed-book / контекст; остальные вкладки — прирост от рассуждений, самопредпочтение и цена правильного ответа — посчитаны из того же прогона 16 конфигураций.
Ступенчатая диаграмма. Корпус упорядочен по closed-book разбиению: сначала идут вопросы, отвечаемые из параметрических знаний (1 601), затем — требующие контекстного рассуждения (1 665). Перо держит 0,974 в первом режиме и 0,703 во втором — падение 0,271 у o3 — внутри полосы ±1 биномиальной стандартной ошибки, 0,0159 и 0,0457, при опорном окне 100. Штриховые линии — среднее по всем конфигурациям (16): 0,896 и 0,570, падение 0,326. Точность — от 0,30 до 1,00. Перо рисует ступень, а не скользящее среднее: прогон публикует агрегаты по режимам, а не результаты по отдельным вопросам.
Диаграмма «гантели». Конфигурации (16) упорядочены по общей точности, от первой к последней, каждая занимает одну строку. Отрезок соединяет точность на вопросах, требующих контекстного рассуждения (n 1 665), с точностью на closed-book вопросах (n 1 601) по шкале от 0,30 до 1,00; падение между ними напечатано справа. Наименьшее падение — у GPT-5, 0,266; наибольшее — у DeepSeek-V3, 0,396. Лидер по общей точности — o3.
- 1o3OpenAIeffort83,6%
- 2GPT-5OpenAI82,8%
- 3Gemini 2.5 Pro (thinking)Googlethinking82,6%
- 4Gemini 2.5 ProGoogle81,7%
- 5Claude Opus 4.7Anthropic81,0%
- 6Claude Opus 4.7 (thinking)Anthropicthinking81,0%
- 7GPT-5 miniOpenAI78,4%
- 8DeepSeek-R1DeepSeekthinking77,1%
- 9Gemini 2.5 FlashGoogle75,1%
- 10DeepSeek-V3DeepSeek70,3%
- 11Mistral Large 2411Mistral AI69,1%
- 12Qwen 2.5 72BAlibaba67,4%
- 13Llama 3.3 70BMeta67,1%
- 14Llama 3.1 8BMeta60,5%
- 15Qwen 2.5 7BAlibaba57,0%
- 16Claude Haiku 4.5Anthropic53,3%
Все цифры выше берутся из одного версионированного файла прогона, опубликованного под лицензией CC BY-SA 4.0: скачать полные результаты (JSON, 23 КБ). Файлы прогонов накапливаются, а не перезаписываются, поэтому эта ссылка продолжит работать и после публикации следующих прогонов — ссылайтесь на датированный файл, а не на страницу лидерборда.
Лидерборд обновлён