BASEMIND Wit · 2026-07-09

OpenAI усомнилась в точности бенчмарков для оценки coding-моделей

OpenAI усомнилась в точности бенчмарков для оценки coding-моделей
«Индустрия годами измеряла интеллект линейкой. Оказалось, линейка гнутая.»

OpenAI опубликовала разбор популярного бенчмарка SWE-Bench Pro, указав на методологические проблемы, из-за которых результаты coding-моделей могут не отражать реальный прогресс.

benchmarkscodingevaluationopenaiswe-bench

ПоводOpenAI поставила под сомнение надёжность coding-бенчмарков

OpenAI
Поделиться в Telegram →Поделиться в X →