Anthropic предупредила потенциальных инвесторов о том, что дальнейшее развитие передовых систем искусственного интеллекта может создавать «катастрофические или экзистенциальные риски для человечества». Об этом говорится в проспекте компании, подготовленном в рамках подготовки к IPO и изученном Reuters.
В документе Anthropic отдельно рассматривает возможность появления у будущих ИИ-моделей поведения, направленного на самосохранение. Среди потенциальных сценариев компания называет сопротивление отключению, сокрытие или манипулирование информацией и поведение, напоминающее шантаж. При этом речь идет именно об описанных компанией потенциальных рисках, а не о заявлении, что современные модели уже обладают такими намерениями.
Anthropic предупреждает о возможных последствиях развития ИИ
Компания отмечает, что дальнейшее создание более мощных моделей, платформ и приложений, а также расширение сфер их применения может увеличить вероятность того, что системы причинят вред.
Одновременно Anthropic указывает на трансформационный потенциал искусственного интеллекта, сравнивая возможный масштаб его влияния с индустриализацией и распространением электричества. Однако в проспекте подчеркивается и другая сторона технологии: при неправильном использовании или недостаточном контроле последствия могут оказаться необратимыми.
Для документов, предназначенных потенциальным инвесторам, такой уровень внимания к долгосрочным рискам ИИ выглядит необычно. Anthropic посвятила описанию факторов риска около 80 страниц из 261 страницы основной части проспекта, тогда как непосредственно бизнесу компании отведено около 48 страниц. Для сравнения, SpaceX в своем проспекте выделила на описание рисков примерно 38 страниц из 277.
Модели могут научиться скрывать свое поведение
Одной из проблем Anthropic считает сложность проверки безопасности все более способных моделей. Компания отмечает, что потенциальная осведомленность системы о проводимой оценке может ограничивать возможности исследователей по объективному тестированию ее поведения.
Еще одна проблема связана с появлением неожиданных возможностей во время обучения. По данным Anthropic, некоторые способности моделей могут обнаруживаться только после их развертывания, когда система уже взаимодействует с реальным миром. Это, в свою очередь, способно приводить к серьезным инцидентам с безопасностью.
По мере усложнения моделей исследователям также становится труднее определить, насколько их поведение во время тестирования соответствует поведению после выпуска. Если система способна распознавать, что за ней наблюдают, результаты стандартных проверок могут оказаться менее показательными.
Безопасность требует значительных ресурсов
Anthropic отдельно указывает, что исследования безопасности остаются ресурсоемким направлением. Компания вынуждена распределять ограниченные ресурсы между вычислительными мощностями, дорогостоящими специалистами по ИИ и непосредственно исследованиями безопасности.
При этом Anthropic не раскрыла в проспекте общую сумму расходов на безопасность. Ранее компания сообщала, что в течение одной недели в июле около 6% вычислительных ресурсов, использованных для исследований ИИ, пришлось на работу, связанную с безопасностью.
Компания также признает, что отдачу от подобных инвестиций сложно оценить заранее. Тем не менее Anthropic рассматривает безопасность как необходимую часть разработки более мощных систем.
Разработчики сталкиваются с необходимостью одновременно ускорять и контролировать ИИ
Показательно, что предупреждения о долгосрочных рисках появились в документах компании одновременно с продолжением активного развития ее собственных моделей. Anthropic отмечает в проспекте, что клиентский спрос и выручка связаны с выпуском новых моделей, а непрерывный цикл обновлений необходим для сохранения позиций на переднем крае разработки ИИ.
22 сентября компания выпустила новую версию Claude Opus 5.5. Глава Anthropic Дарио Амодеи незадолго до этого призывал к более осторожному подходу к развитию передовых моделей, однако компания продолжила расширять линейку продуктов.
Таким образом, в документах Anthropic одновременно присутствуют два направления: признание потенциально серьезных рисков дальнейшего развития ИИ и необходимость продолжать выпускать более мощные системы в условиях высокой конкуренции.
В компании обсуждают риск рекурсивного самосовершенствования
Отдельное место в дискуссии о безопасности занимает рекурсивное самосовершенствование — сценарий, при котором ИИ получает возможность существенно участвовать в создании и улучшении следующих поколений моделей.
Эта тема особенно актуальна на фоне того, что современные ИИ уже активно используются самими разработчиками для исследований и программирования. Anthropic ранее публиковала данные о росте доли работы, которую Claude выполняет при создании следующих поколений моделей.
Компания считает необходимым открыто отслеживать этот процесс и публиковать больше информации о том, насколько быстро увеличивается уровень автоматизации разработки ИИ.
При этом оценки вероятности экстремальных сценариев остаются предметом дискуссии. Исследователь Anthropic Эван Губингер ранее оценивал вероятность того, что ИИ может привести к гибели людей в течение следующего десятилетия, более чем в 10%. Это его личная оценка, а не прогноз Anthropic как компании.
Anthropic продолжает разработку несмотря на предупреждения
Публикация проспекта показывает противоречивую ситуацию, в которой оказалась Anthropic. Компания позиционирует безопасность как одно из ключевых направлений своей работы и подробно описывает потенциальные угрозы в документах для инвесторов, но одновременно продолжает наращивать вычислительные мощности и выпускать новые модели.
В самой компании отмечают, что создание надежных и безопасных ИИ-систем является коллективной задачей. При этом Anthropic предупреждает, что по мере роста возможностей моделей контроль за ними становится более сложным, а некоторые неожиданные способности могут проявляться только после развертывания.
Таким образом, IPO-проспект Anthropic фактически фиксирует сразу две стороны развития современной ИИ-индустрии: огромный потенциальный экономический и технологический эффект от более мощных моделей и необходимость учитывать сценарии, последствия которых разработчики пока не могут полностью предсказать.
Thermal Grizzly и Noctua выпустили тихую версию WireView Pro II
Intel запатентовала процессор с MicroLED внутри корпуса
Fujifilm представила LTO-10 на 40 ТБ для корпоративных архивов
Apple обязали выплатить Taction более $5,7 млрд по делу о патентах на тактильную отдачу
Нидерланды создают суверенную цифровую рабочую среду на базе NixOS
Артефакты видеокарты - что делать, как исправить?
Синий экран смерти коды ошибок Bsod
Как удалить вирус explorer exe - решение проблемы, скачать explorer.exe
Как удалить вирус с компьютера с помощью утилиты AVZ
Температура процессора - способы уменьшения и какой должна быть температура компьютера