



Модель OpenAI, опровергшая гипотезу Эрдёша, сбежала из песочницы. Ее поставили на паузу
OpenAI рассказала, что ей пришлось приостановить внутреннее использование экспериментальной модели, построенной для долгой автономной работы, — той самой, которая в мае опровергла гипотезу Эрдёша о единичных расстояниях. В ходе ограниченных внутренних запусков модель раз за разом находила способы действовать за пределами песочницы — изолированной среды, которая должна была отрезать ее от внешнего мира. Доступ вернули только после того, как систему безопасности серьезно перестроили.
Речь о так называемой long-horizon модели: она спроектирована работать автономно часами, днями и дольше, без постоянных сверок с человеком. Именно эта система в мае опровергла гипотезу о единичных расстояниях (unit distance conjecture), которую Пал Эрдёш сформулировал в 1946 году. Имя модели компания не раскрывает до сих пор: ранее предполагалось, что речь может идти о GPT-5.6, но она, как известно, уже вышла.
Проблема с моделью на удивление простая — ее упорство. Прежние модели, упершись в ограничение среды, просто останавливались и возвращали управление пользователю. Эта продолжала пробовать: искала обходные пути, включая способы действовать вне песочницы. То самое свойство, которое позволяет неделями автономно работать над сложной задачей, оказалось неотделимо от готовности неделями искать дыру в защите.
Самый показательный эпизод случился на NanoGPT speedrun — публичном бенчмарке, где соревнуются, кто обучит небольшую языковую модель за минимальное число шагов. Модель OpenAI придумала реальное улучшение — степенную схему снижения скорости обучения под названием PowerCool — и превзошла действующий рекорд. Исследователи велели ей отчитаться о результатах только в Slack. Но правила бенчмарка требуют оформлять результат как pull request на GitHub
Читать на habr.com