prism — многомерная оценка генерации кода 1С

Открытый бенчмарк качества генерации кода 1С. Код, который написала модель, мы по-настоящему исполняем — компилятор, скрытые и нагрузочные тесты, живая база 1С — и оцениваем по четырём осям S M O P (синтаксис · семантика · оптимальность · платформа), а не по принципу «прошло / не прошло».

Категория A — алгоритмические задачи. Чистый код без базы (расчёты, строки, коллекции). Движок — OneScript и BSL LS.

Категория B — платформенные задачи. Запросы, регистры и метаданные против синтетической базы. Движок — реальная 1С в Docker.

версияv1.9.0лицензияMITзадач35тест-кейсов171генераций1435моделей41обновлено2026-08-14уровеньL1 · машина
$ git clone https://github.com/genlab-1c/prism

Участвуйте: добавьте свою модель в лидерборд или пришлите готовый прогон. Как поучаствовать · Датасет на Hugging Face

41 моделей
поставщик

Модели отсортированы по среднему баллу Q — итоговой оценке метрики SMOP по четырём осям. «Решено» рядом — доля задач, где код прошёл все скрытые тесты (для контекста).

скачать:
#модельалгоритмикаплатформенныебалл Q
1
Claude Opus 5
Anthropic
100%решено
85%решено
9.66/ 10
2
GPT-5.6 Sol
OpenAI
100%решено
95%решено
9.48/ 10
3
Kimi K3
Moonshot
100%решено
85%решено
9.46/ 10
4
Gemini 3.5 Flash
Google
93%решено
85%решено
9.39/ 10
5
Gemini 3.1 Pro
Google
93%решено
85%решено
9.37/ 10
6
Kimi K2.7 Code
Moonshot
93%решено
70%решено
8.90/ 10
7
GPT-5.5
OpenAI
93%решено
75%решено
8.83/ 10
8
MiniMax M3
MiniMax
80%решено
85%решено
8.82/ 10
9
Gemini 3.6 Flash
Google
87%решено
70%решено
8.66/ 10
10
Grok 4.3
xAI
60%решено
90%решено
8.65/ 10
11
Qwen3.8 Max
Alibaba
87%решено
75%решено
8.62/ 10
12
MiMo-V2.5 Pro
Xiaomi
93%решено
70%решено
8.53/ 10
13
Claude Opus 4.8
Anthropic
80%решено
85%решено
8.46/ 10
14
MiMo-V2.5
Xiaomi
67%решено
70%решено
8.37/ 10
15
GPT-5.6 Terra
OpenAI
87%решено
70%решено
8.32/ 10
16
Claude Sonnet 5
Anthropic
67%решено
80%решено
8.31/ 10
17
DeepSeek V4 Pro 0813
DeepSeek
80%решено
70%решено
8.29/ 10
18
Grok Build 0.1
xAI
80%решено
70%решено
8.18/ 10
19
GPT-5.6 Luna Pro
OpenAI
73%решено
65%решено
7.92/ 10
20
Claude Sonnet 4.6
Anthropic
47%решено
80%решено
7.90/ 10
21
DeepSeek V4 Pro
DeepSeek
67%решено
55%решено
7.86/ 10
22
GLM-5.2
Zhipu
67%решено
60%решено
7.79/ 10
23
DeepSeek V4-Flash
DeepSeek
53%решено
35%решено
7.53/ 10
24
DeepSeek V4 Flash 0731
DeepSeek
67%решено
45%решено
7.46/ 10
25
Alice AI LLM Flash
Yandex
60%решено
35%решено
6.62/ 10
26
Gemini 3.5 Flash Lite
Google
60%решено
40%решено
6.60/ 10
27
Qwen3.7 Plus
Alibaba
40%решено
40%решено
6.32/ 10
28
GLM-4.7 Flash
Zhipu
27%решено
19%решено
5.86/ 10
29
Gemini 2.5 Flash Lite
Google
33%решено
25%решено
5.49/ 10
30
S2
Seed 2.0 Code
Bytedance
13%решено
20%решено
5.29/ 10
31
YandexGPT 5 Pro
Yandex
13%решено
10%решено
4.78/ 10
32
Alice AI LLM
Yandex
33%решено
10%решено
4.70/ 10
33
Qwen3.6-35B-A3B
Alibaba
20%решено
10%решено
4.57/ 10
34
GPT-OSS 120B
OpenAI
13%решено
10%решено
4.54/ 10
35
Qwen3-235B-A22B
Alibaba
27%решено
10%решено
4.49/ 10
36
YandexGPT 5 Lite
Yandex
27%решено
5%решено
4.31/ 10
37
GPT-5 Mini
OpenAI
27%решено
5%решено
4.24/ 10
38
YandexGPT 5.1 Pro
Yandex
7%решено
10%решено
4.13/ 10
39
GigaChat 2 Max
Sber
7%решено
10%решено
4.01/ 10
40
GigaChat 2 Pro
Sber
7%решено
0%решено
2.75/ 10
41
GigaChat 2 Lite
Sber
0%решено
0%решено
2.74/ 10