Что умеет сейчас

Здесь честно: что в PRISM уже работает, чем это подтверждено и что в планах. Где функция сырая — так и написано.

В двух словах

Автоматическая оценка (Уровень 1) работает для обеих категорий задач: код компилируется, прогоняется скрытыми тестами и запускается в реальной 1С. Слой эксперта (Уровень 2) — пока в планах: для него нужны живые специалисты.

Правила и пороги живут в файлах метрики (metrics/), а где наша оценка надёжна, а где ещё нет — на странице Честные границы. Здесь — только карта состояния.

Что уже работает

СпособностьСостояниеЧем подтверждено
Категория A — оси Синтаксис, Семантика, Оптимальность автоматическиготовоprism check: эталоны A набирают M=10, тесты зелёные
Категория B — запуск кода в реальной 1Сготовоprism check: эталоны B проходят «S=10 · M=10 · P чисто»
Синтаксис категории B проверяет компилятор 1Сготовоошибки ловит настоящий компилятор (/CheckModules), а не приблизительный анализатор
Платформа (P) из запуска — «пережил ли код контакт с базой»готовообращение к несуществующему полю ловится и отделяется от просто неверного ответа
Кто виноват — код или окружениеготовокод не компилируется → 0; нет Docker и т.п. → «не измерено», а не 0
Сборка синтетической базы из описания задачиготовобаза собирается из описания и грузится в 1С без ошибок
Полный прогон оценки (S · M · O · P + общий балл Q)готовоодной командой prism score для категорий A и B
Уровень 2 — эксперты и согласие с машинойв планахпрототип платформы разметки — genlab-1c-web; согласие пока не посчитать — нужен не один эксперт

Из чего состоит

Результаты

Авто-прогон Уровня 1

Средний общий балл Q на одних и тех же задачах (полные векторы S·M·O·P и срезы по навыкам — на странице Лидерборд). Таблица регенерируется командой prism docs:

МодельQ · категория AQ · категория B
Claude Opus 59.739.60
Kimi K39.739.26
Gemini 3.5 Flash9.689.18
Gemini 3.1 Pro9.479.30
Kimi K2.7 Code9.478.48
GPT-5.6 Sol9.339.59
MiMo-V2.5 Pro9.228.02
GPT-5.59.098.63
Gemini 3.6 Flash9.078.35
Qwen3.8 Max9.078.28
GPT-5.6 Terra8.807.97
Grok Build 0.18.537.91
DeepSeek V4 Pro 08138.508.13
MiniMax M38.279.24
GLM-5.28.217.47
MiMo-V2.58.138.55
GPT-5.6 Luna Pro8.027.84
DeepSeek V4 Pro7.997.76
DeepSeek V4 Flash 07317.967.08
Claude Opus 4.87.898.88
Claude Sonnet 57.888.63
DeepSeek V4-Flash7.727.39
Grok 4.37.709.36
Gemini 3.5 Flash Lite7.615.83
Alice AI LLM Flash7.256.15
GLM-4.7 Flash6.515.37
Claude Sonnet 4.66.339.08
Gemini 2.5 Flash Lite6.294.89
Alice AI LLM6.203.58
Qwen3.7 Plus5.896.65
GPT-5 Mini5.763.10
Qwen3-235B-A22B5.573.68
Qwen3.6-35B-A3B5.533.86
Seed 2.0 Code5.495.15
YandexGPT 5 Pro5.434.30
GPT-OSS 120B5.403.89
GigaChat 2 Max5.133.17
YandexGPT 5 Lite4.903.86
YandexGPT 5.1 Pro4.773.66
GigaChat 2 Pro3.522.17
GigaChat 2 Lite2.932.60

Таблица выше пересобирается автоматически (prism docs), а состав моделей и банк задач растут от прогона к прогону. Поэтому имён победителей в тексте нет — они устареют к следующему прогону; кто впереди сейчас, смотрите на лидерборде.

Что видно из прогонов. Ранги по A и B заметно расходятся: сильная алгоритмика ещё не означает умения работать с метаданными 1С. Это разные навыки — потому оси и считаются порознь, а не сводятся к одной галочке. Размер модели навык в 1С не предсказывает: среди отстающих регулярно оказываются модели на сотни миллиардов параметров. А ось Платформа разводит модели по одному признаку — выдумывает модель метаданные или нет.

Это первый авто-прогон

Одна генерация на задачу, недорогие модели, Уровень 1 без экспертной сверки. Границы применимости — Честные границы. Полные срезы по навыкам — на странице Лидерборд.

Что в планах (по приоритету)

  1. Больше задач. Банк пока небольшой, а от числа и разнообразия заданий напрямую зависит, можно ли уверенно говорить «эта модель лучше той». Рост банка — приоритет №1 (как добавить — Как участвовать).
  2. Открытый прогон на актуальных моделях — больше моделей и генераций, свежие честные цифры на лидерборде.
  3. Уровень 2 с двумя-тремя экспертами — первое настоящее измерение согласия машины и эксперта (главный научный результат проекта).
  4. Проверки категории B на YAXUNIT — стандартный для 1С формат модульных тестов (сейчас формат свой; смысл проверок при переходе сохранится).
  5. Скорость категории B — кэш собранной базы под каждую задачу. Пока главное уже снимает параллелизм (PRISM_CONCURRENCY): ~10–20 секунд на кандидата, общее время масштабируется по ядрам.