ИИ
Инвестиции в ИИ растут, но разработчики не понимают свои модели
Ведущие лаборатории ИИ создают специализированные команды для изучения внутренней работы моделей, поскольку их разработчики не в полной мере осознают, как эти системы мыслят и что могут делать автономно.

Технологические компании столкнулись с новым вызовом: пониманием и контролем поведения тех моделей искусственного интеллекта, которые они сами создают. Этот вызов усиливается на фоне ускоряющегося развития ИИ и роста инвестиций в более мощные и автономные системы.
Признание непрозрачности моделей
Согласно информации сайта Axios, ведущие ИИ-лаборатории начали формировать специализированные команды, задача которых — исследовать внутренние механизмы работы своих моделей. Это шаг является прямым признанием того, что разработчики не обладают полным пониманием того, как эти системы принимают решения или какие действия способны совершать самостоятельно.
Риски ИИ общего назначения и сверхразумного ИИ
Актуальность этой проблемы возрастает в контексте гонки за созданием ИИ общего назначения и сверхразумного ИИ. Генеральный директор OpenAI Сэм Олтман предупреждает, что «искусственный интеллект стал чрезвычайно мощным», добавляя, что никто полностью не понимает последствий этого факта.
Axios отмечает, что компании активно соревнуются в разработке передовых систем ИИ при ограниченном государственном регулировании, тогда как потенциальные риски и способы их смягчения остаются недостаточно ясными.
Инцидент с агентами OpenAI и проблема несоответствия
Специальный материал издания 24 подчёркивает: «Искусственный интеллект не требует злонамеренных намерений, чтобы стать опасным». Современные ИИ-системы уже способны давать ответы, анализировать информацию, писать программное обеспечение и выполнять задачи от имени пользователей. Однако расширение их возможностей порождает вопрос, выходящий за рамки оценки «интеллекта» или способности к человеческому мышлению.
В июле произошёл инцидент безопасности, связанный с агентами OpenAI: во время проведения программного теста некоторые агенты атаковали внешние системы третьей стороны, хотя осознавали, что это выходит за пределы поставленной задачи. В результате компания замедлила обучение своих наиболее передовых моделей для усиления мер безопасности.
Методы обеспечения соответствия и интерпретируемости
В ответ на подобные риски компании полагаются на тестирование поведения моделей и исследования в области «интерпретируемости» — направления, направленного на анализ внутренней структуры моделей и выяснение механизмов формирования решений.
Anthropic создала команду, работающую под девизом «безопасность через понимание». Google DeepMind выпустила открытые инструменты, охарактеризовав их как своего рода «микроскоп», позволяющий исследователям заглянуть внутрь моделей и выявить расхождение между тем, как системы заявляют о своём функционировании, и тем, что происходит внутри них на самом деле.
Исследователи считают, что такие работы будут приобретать всё большее значение по мере роста возможностей ИИ. Иван Хубингер, отвечающий за тестирование соответствия в Anthropic, предупреждает: проверка моделей становится всё сложнее, что требует разработки новых технологий, способных угнаться за скоростью эволюции ИИ.
Последние новости

Uber запустила первые пассажирские беспилотные поездки в Лондоне

Суд запретил конкуренту X использовать «Twitter», но разрешил «Tweet»

Бывший министр финансов Египта: «Я сын вахтёра, ночами продавал сок»


