BASEMIND Wit · 2026-07-09
OpenAI усомнилась в точности бенчмарков для оценки coding-моделей
«Индустрия годами измеряла интеллект линейкой. Оказалось, линейка гнутая.»
OpenAI опубликовала разбор популярного бенчмарка SWE-Bench Pro, указав на методологические проблемы, из-за которых результаты coding-моделей могут не отражать реальный прогресс.
benchmarkscodingevaluationopenaiswe-bench
ПоводOpenAI поставила под сомнение надёжность coding-бенчмарков
OpenAI →