Перейти к содержанию

Первые в мире двойные слепые оценки ИИ: DeepMind начала пилот

### Почему обычные бенчмарки больше не работают

Первые в мире двойные слепые оценки ИИ: DeepMind начала пилот, который может изменить то, как мы меряем ум машин. Суть новости простая, но от этого не менее важная: вместо очередного публичного бенчмарка с заранее известными вопросами компания тестирует схемы, в которых ни модель, ни проверяющий не знают, что является предметом оценки. По сути это перенос принципов доказательной медицины в область валидации нейросетей.

Почему обычные бенчмарки больше не работают

Классическая проблема современных AI-соревнований называется contamination (загрязнение данных). Новый публичный тест появляется в открытом доступе, и в следующие же месяцы его вопросы попадают в обучающие выборки. Модель не обязательно «зубрит» ответы в лоб, но статистически она видела слишком похожие формулировки, чтобы её результат считался честным.

Показательны случаи, когда один и тот же бенчмарк через полгода после релиза начинает «проходить» сразу все свежие модели с подозрительно растущим процентом. Исследователи списывают это на рост архитектур, но часто причина проще: тест уже не проверяет способность рассуждать, он проверяет способность угадывать. Двойная слепота эту лазейку закрывает в корне.

Что значит «двойная слепота» в контексте ИИ

В медицине двойной слепой метод подразумевает, что ни пациент, ни врач не знают, кто получил препарат, а кто плацебо. Это исключает самовнушение и предвзятость при оценке результата. В ИИ схема переводится иначе: модель не должна догадываться, что её проверяют, а человек-оценщик не должен знать, какую именно систему он оценивает.

DeepMind в пилоте тестирует, как такие условия можно создать на практике. Вероятно, речь идёт о генерации свежих задач прямо во время оценки, о ротации формулировок и о скрытии идентичности модели от жюри. Детали не раскрыты, но направление ясное: сделать так, чтобы ответы нельзя было выучить заранее, а интерпретацию результатов - подогнать под любимчика.

Почему это не панацея

Двойная слепота решает проблему утечек, но создаёт новые сложности. Во-первых, оценка становится дороже: заготовить уникальные вопросы для каждого прогона сложнее, чем использовать статический публичный набор. Во-вторых, модель может быть слепа только при условии, что её обучение завершено. Если в процессе участвует RLHF или дообучение в реальном времени, слепота нарушается.

В-третьих, интерпретация ответов остаётся частично субъективной. Даже если проверяющий не знает, что перед ним GPT или Claude, он может оценивать не качество, а стиль. Правда, именно для этого двойная слепота и нужна: она снижает количество подсознательных симпатий в пользу известных брендов.

Что взять из новости в свою работу

Для разработчиков, которые собирают собственные оценочные наборы, здесь полезный урок: вместо того чтобы плодить сотни статичных промптов, стоит подумать об автоматической генерации вариантов и о закрытых удержанных тестах. Любой набор задач, который живёт дольше пары месяцев, рано или поздно начинает протекать.

Практический минимум на сегодня: не доверять результатам свежевышедших бенчмарков, если их вопросы публичны, а также хранить валидационную выборку подальше от датасетов для обучения. Именно к такой гигиене подталкивает инициатива DeepMind. Двойные слепые оценки вряд ли появятся у каждой команды завтра, но базовый принцип - изолировать проверку от материала для тренировки - стоит взять на вооружение уже сейчас.

Пусть это и пилот, но первые двойные слепые тесты открывают эпоху, когда репутация модели перестанет зависеть от того, кто сколько вопросов запомнил. Это медленный и не самый дешёвый путь, зато он возвращает бенчмаркам их изначальный смысл: измерение мышления, а не памяти.

Читайте также