Что умеет сейчас
Здесь честно: что в PRISM уже работает, чем это подтверждено и что в планах. Где функция сырая — так и написано.
В двух словах
Автоматическая оценка (Уровень 1) работает для обеих категорий задач: код компилируется, прогоняется скрытыми тестами и запускается в реальной 1С. Слой эксперта (Уровень 2) — пока в планах: для него нужны живые специалисты.
Правила и пороги живут в файлах метрики (metrics/), а где наша оценка надёжна, а где ещё
нет — на странице Честные границы. Здесь — только карта состояния.
Что уже работает
| Способность | Состояние | Чем подтверждено |
|---|---|---|
| Категория A — оси Синтаксис, Семантика, Оптимальность автоматически | готово | prism check: эталоны A набирают M=10, тесты зелёные |
| Категория B — запуск кода в реальной 1С | готово | prism check: эталоны B проходят «S=10 · M=10 · P чисто» |
| Синтаксис категории B проверяет компилятор 1С | готово | ошибки ловит настоящий компилятор (/CheckModules), а не приблизительный анализатор |
| Платформа (P) из запуска — «пережил ли код контакт с базой» | готово | обращение к несуществующему полю ловится и отделяется от просто неверного ответа |
| Кто виноват — код или окружение | готово | код не компилируется → 0; нет Docker и т.п. → «не измерено», а не 0 |
| Сборка синтетической базы из описания задачи | готово | база собирается из описания и грузится в 1С без ошибок |
| Полный прогон оценки (S · M · O · P + общий балл Q) | готово | одной командой prism score для категорий A и B |
| Уровень 2 — эксперты и согласие с машиной | в планах | прототип платформы разметки — genlab-1c-web; согласие пока не посчитать — нужен не один эксперт |
Из чего состоит
- Задачи — двух категорий: алгоритмические (
tasks/category_a/) и платформенные (tasks/category_b/). У платформенной задачи есть описание своей синтетической базы, тестовые данные, проверки и эталонное решение. Эталоны проверяются настоящим запуском вprism check. - Метрика — правила оценки в
metrics/: ось Платформа считается запуском кода, прежняя проверка «на глаз» убрана. - Запуск кода — по умолчанию в Docker-песочнице (недоверенный код ИИ): OneScript для
категории A, headless-1С для категории B, плюс автоматическая сборка синтетической базы. Хост —
опционально (
--runner/--bsl local). - Оценка — модули
harness/score/(по одному на каждую ось); один запуск в 1С даёт сразу и Семантику (M), и Платформу (P).
Результаты
Авто-прогон Уровня 1
Средний общий балл Q на одних и тех же задачах (полные векторы S·M·O·P и срезы по навыкам —
на странице Лидерборд). Таблица регенерируется командой prism docs:
| Модель | Q · категория A | Q · категория B |
|---|---|---|
| Claude Opus 5 | 9.73 | 9.60 |
| Kimi K3 | 9.73 | 9.26 |
| Gemini 3.5 Flash | 9.68 | 9.18 |
| Gemini 3.1 Pro | 9.47 | 9.30 |
| Kimi K2.7 Code | 9.47 | 8.48 |
| GPT-5.6 Sol | 9.33 | 9.59 |
| MiMo-V2.5 Pro | 9.22 | 8.02 |
| GPT-5.5 | 9.09 | 8.63 |
| Gemini 3.6 Flash | 9.07 | 8.35 |
| Qwen3.8 Max | 9.07 | 8.28 |
| GPT-5.6 Terra | 8.80 | 7.97 |
| Grok Build 0.1 | 8.53 | 7.91 |
| DeepSeek V4 Pro 0813 | 8.50 | 8.13 |
| MiniMax M3 | 8.27 | 9.24 |
| GLM-5.2 | 8.21 | 7.47 |
| MiMo-V2.5 | 8.13 | 8.55 |
| GPT-5.6 Luna Pro | 8.02 | 7.84 |
| DeepSeek V4 Pro | 7.99 | 7.76 |
| DeepSeek V4 Flash 0731 | 7.96 | 7.08 |
| Claude Opus 4.8 | 7.89 | 8.88 |
| Claude Sonnet 5 | 7.88 | 8.63 |
| DeepSeek V4-Flash | 7.72 | 7.39 |
| Grok 4.3 | 7.70 | 9.36 |
| Gemini 3.5 Flash Lite | 7.61 | 5.83 |
| Alice AI LLM Flash | 7.25 | 6.15 |
| GLM-4.7 Flash | 6.51 | 5.37 |
| Claude Sonnet 4.6 | 6.33 | 9.08 |
| Gemini 2.5 Flash Lite | 6.29 | 4.89 |
| Alice AI LLM | 6.20 | 3.58 |
| Qwen3.7 Plus | 5.89 | 6.65 |
| GPT-5 Mini | 5.76 | 3.10 |
| Qwen3-235B-A22B | 5.57 | 3.68 |
| Qwen3.6-35B-A3B | 5.53 | 3.86 |
| Seed 2.0 Code | 5.49 | 5.15 |
| YandexGPT 5 Pro | 5.43 | 4.30 |
| GPT-OSS 120B | 5.40 | 3.89 |
| GigaChat 2 Max | 5.13 | 3.17 |
| YandexGPT 5 Lite | 4.90 | 3.86 |
| YandexGPT 5.1 Pro | 4.77 | 3.66 |
| GigaChat 2 Pro | 3.52 | 2.17 |
| GigaChat 2 Lite | 2.93 | 2.60 |
Таблица выше пересобирается автоматически (prism docs), а состав моделей и банк задач растут
от прогона к прогону. Поэтому имён победителей в тексте нет — они устареют к следующему
прогону; кто впереди сейчас, смотрите на лидерборде.
Что видно из прогонов. Ранги по A и B заметно расходятся: сильная алгоритмика ещё не означает умения работать с метаданными 1С. Это разные навыки — потому оси и считаются порознь, а не сводятся к одной галочке. Размер модели навык в 1С не предсказывает: среди отстающих регулярно оказываются модели на сотни миллиардов параметров. А ось Платформа разводит модели по одному признаку — выдумывает модель метаданные или нет.
Это первый авто-прогон
Одна генерация на задачу, недорогие модели, Уровень 1 без экспертной сверки. Границы применимости — Честные границы. Полные срезы по навыкам — на странице Лидерборд.
Что в планах (по приоритету)
- Больше задач. Банк пока небольшой, а от числа и разнообразия заданий напрямую зависит, можно ли уверенно говорить «эта модель лучше той». Рост банка — приоритет №1 (как добавить — Как участвовать).
- Открытый прогон на актуальных моделях — больше моделей и генераций, свежие честные цифры на лидерборде.
- Уровень 2 с двумя-тремя экспертами — первое настоящее измерение согласия машины и эксперта (главный научный результат проекта).
- Проверки категории B на YAXUNIT — стандартный для 1С формат модульных тестов (сейчас формат свой; смысл проверок при переходе сохранится).
- Скорость категории B — кэш собранной базы под каждую задачу. Пока главное уже снимает
параллелизм (
PRISM_CONCURRENCY): ~10–20 секунд на кандидата, общее время масштабируется по ядрам.
