Metkagram · Evaluation
Benchmark поиска языковых паттернов
Проверяем узкую вещь: может ли система по естественной коммуникативной задаче найти правильное намерение, логический ход и допустимый канонический паттерн Metkagram.
Показанные результаты относятся к встроенному deterministic resolver и являются внутренним regression-сигналом, а не независимой оценкой модели или доказательством эффективности обучения.
Что получает система
Только естественный запрос. В ответ она должна ранжировать intent, определить reasoning move и вернуть до трёх canonical pattern IDs.
Метрики
Intent top-1
Ожидаемый intent стоит первым.
Move top-1
Ожидаемый reasoning move стоит первым.
Pattern hit@3
Хотя бы один редакционно допустимый паттерн попал в первые три результата.
Как публиковать результаты
- Зафиксируйте dataset version и дату запуска.
- Укажите модель/систему, версию и prompt/retrieval configuration.
- Скажите, был ли доступ к taxonomy, API или corpus Metkagram.
- Покажите все три метрики и misses/abstentions.
Ограничения
Gold labels публичны, а benchmark и встроенный resolver поддерживаются одним проектом. Это удобно для воспроизводимости и регрессии, но плохо подходит для громких заявлений о превосходстве над LLM. Для внешней валидации нужен независимо составленный held-out набор.