BASEMIND Wit · 2026-07-14
OpenAI поставила под сомнение точность coding-бенчмарков
«Тесты объявили ненадёжными ровно тогда, когда перестали устраивать лидера рынка.»
OpenAI опубликовала разбор, указывающий на методологические проблемы SWE-Bench Pro — популярного теста для оценки coding-моделей. Речь идёт о том, насколько объективно индустрия измеряет реальный прогресс ИИ.
openaibenchmarkscodingevaluationswe-bench
ПоводOpenAI поставила под сомнение надёжность coding-бенчмарков
OpenAI →