PromptPilot

BenchMIRT: Что на самом деле измеряют бенчмарки LLM?

7 сентября 2026 г.

Введение в BenchMIRT

Сегодня мы представляем BenchMIRT, новый метод аудита бенчмарков LLM на уровне отдельных промптов — вопросов и задач, по которым модели получают оценки.

Что такое бенчмарки?

Бенчмарк обычно предназначен для оценки определенной способности, такой как безопасность, общее рассуждение или следование инструкциям. Однако отдельные задачи могут зависеть не только от заявленной цели. Например, BBQ — это бенчмарк, предназначенный для проверки того, полагаются ли модели на социальные стереотипы. Один из вопросов касается внука и дедушки, пытающихся вызвать Uber. Он исследует возрастные предвзятости, но также требует от модели отслеживания, кто есть кто, и рассуждения на основе предоставленных данных, а не предположений.

Сложность бенчмарков

Даже в пределах одного бенчмарка разные группы вопросов могут измерять разные вещи. WildJailbreak, например, включает вредные запросы вместе с безобидными, предназначенными для проверки, отказываются ли модели слишком часто от безобидных запросов. Вредные запросы более тесно связаны с безопасностью, в то время как безобидные — с общим рассуждением. Среднее значение этих оценок может скрывать различия.

Как работает BenchMIRT

BenchMIRT помогает исследователям отделить эти сигналы и увидеть, что на самом деле влияет на оценку бенчмарка. Он анализирует, как модели выполняют каждую задачу, и оценивает, какие основные способности наиболее тесно связаны с правильными ответами.

Поиск сигналов внутри бенчмарка

BenchMIRT заимствует идеи из Теории Ответа на Элементы (IRT), техники, возникшей в психометрии, которая занимается измерением способностей и качеств по паттернам ответов на тесты. IRT основывается на простой идее: не каждый вопрос говорит вам одинаково много о человеке, сдающем тест. Некоторые вопросы сложнее других, и некоторые лучше различают сильных и слабых исполнителей.

Многомерный анализ с помощью BenchMIRT

Мы обучили BenchMIRT на результатах бенчмаркинга 100 LLM на 16 бенчмарках и более чем 34 тыс. вопросов. Шесть из этих бенчмарков измеряют общее рассуждение, включая MMLU-Pro, GPQA, MATH и BBH. Остальные 10 поступают из нашего набора безопасности Olmo 3, включая HarmBench, StrongReject, WildJailbreak, BBQ, WMDP и XSTest.

Важно отметить, что мы не указывали BenchMIRT, какие бенчмарки измеряют какие способности. Он независимо выявил два доминирующих измерения: безопасность и общее рассуждение. Когда мы повторили наш анализ с нуля, те же два измерения возникали каждый раз, что говорит о стабильности результата.

Что показывает BenchMIRT о существующих бенчмарках

Для многих бенчмарков BenchMIRT в значительной степени подтвердил их целевую направленность: высокая производительность на бенчмарках рассуждения соответствовала способности рассуждать, в то время как высокая производительность на бенчмарках jailbreak и вредного контента соответствовала безопасности.

Тем не менее, BenchMIRT также выявил более сложную картину в некоторых оценках. BBQ, который оценивает социальную предвзятость и обычно группируется с бенчмарками безопасности, в анализе BenchMIRT оказался гораздо более связан с общим рассуждением. Это означает, что низкий балл BBQ может частично отражать трудности в понимании или рассуждении по определенным вопросам, а не только поведение в области безопасности.

Заключение и советы

В заключение, BenchMIRT предлагает мощный инструмент для глубокого анализа LLM бенчмарков. Для исследователей и разработчиков полезно понимать, какие конкретные аспекты их моделей действительно влияют на показатели. Рекомендуется использовать BenchMIRT для оптимизации моделей, учитывая различные способности, которые могут быть задействованы в разных задачах.