prism — многомерная оценка генерации кода 1С
Открытый бенчмарк качества генерации кода 1С. Код, который написала модель, мы по-настоящему исполняем — компилятор, скрытые и нагрузочные тесты, живая база 1С — и оцениваем по четырём осям S M O P (синтаксис · семантика · оптимальность · платформа), а не по принципу «прошло / не прошло».
Категория A — алгоритмические задачи. Чистый код без базы (расчёты, строки, коллекции). Движок — OneScript и BSL LS.
Категория B — платформенные задачи. Запросы, регистры и метаданные против синтетической базы. Движок — реальная 1С в Docker.
Участвуйте: добавьте свою модель в лидерборд или пришлите готовый прогон. Как поучаствовать · Датасет на Hugging Face
Модели отсортированы по среднему баллу Q — итоговой оценке метрики SMOP по четырём осям. «Решено» рядом — доля задач, где код прошёл все скрытые тесты (для контекста).
