Metkagram · Evaluation

Benchmark поиска языковых паттернов

Проверяем узкую вещь: может ли система по естественной коммуникативной задаче найти правильное намерение, логический ход и допустимый канонический паттерн Metkagram.

54кейсов
100%intent top-1
100%move top-1
100%pattern hit@3

Показанные результаты относятся к встроенному deterministic resolver и являются внутренним regression-сигналом, а не независимой оценкой модели или доказательством эффективности обучения.

Что получает система

Только естественный запрос. В ответ она должна ранжировать intent, определить reasoning move и вернуть до трёх canonical pattern IDs.

Метрики

Intent top-1

Ожидаемый intent стоит первым.

Move top-1

Ожидаемый reasoning move стоит первым.

Pattern hit@3

Хотя бы один редакционно допустимый паттерн попал в первые три результата.

Как публиковать результаты

  1. Зафиксируйте dataset version и дату запуска.
  2. Укажите модель/систему, версию и prompt/retrieval configuration.
  3. Скажите, был ли доступ к taxonomy, API или corpus Metkagram.
  4. Покажите все три метрики и misses/abstentions.

Ограничения

Gold labels публичны, а benchmark и встроенный resolver поддерживаются одним проектом. Это удобно для воспроизводимости и регрессии, но плохо подходит для громких заявлений о превосходстве над LLM. Для внешней валидации нужен независимо составленный held-out набор.