Исследователь Anthropic представил систему автоматизированного выравнивания ИИ

Anthropic: ИИ может самосовершенствоваться, обучая другие модели

Исследователь из программы стипендиатов Anthropic Чэнь Юэх-Хан представил ранний пример того, как обучение моделей ИИ с помощью других моделей ИИ может работать на практике. В опубликованной в пятницу статье «Автоматизированные исследователи могут надежно смягчить сбои выравнивания» описана система, которая повторяет традиционный исследовательский подход: ищет литературу, предлагает методы и тренирует модели, что указывает на возможную практичность автоматизированного выравнивания в ближайшей перспективе.

В пятницу Anthropic опубликовала новую статью под названием «Автоматизированные исследователи могут надежно смягчить сбои выравнивания», в которой подробно описывается, как системы ИИ могут надежно улучшить производительность модели на наборе контрольных показателей выравнивания. Когда были даны 10 критериев для конкретных несоответствующих поведений, автоматизированные системы смогли улучшить производительность на каждом отдельном устройстве без ухудшения общей производительности.

Система, возглавляемая Чэнь Юэх-Ханом, повторяет большую часть традиционного подхода к исследованиям. Каждая автоматизированная система ищет доступную литературу, предлагает метод и тренирует модель, используя этот метод в течение 30 минут, постепенно увеличивая эталон в течение нескольких итераций. Эффективные методы сохраняются, а неэффективные отбрасываются, что позволяет системе работать быстро и в больших масштабах.

«В целом, эти результаты дают ранние доказательства того, что автоматизированное выравнивание после обучения может стать практичным в ближайшей перспективе», — говорится в документе.

Что такое рекурсивное самосовершенствование ИИ?

Исследователь Anthropic представил систему автоматизированного выравнивания ИИ - изображение номер один
Исследователь Anthropic представил систему автоматизированного выравнивания ИИ — изображение номер один — фото из freepik.com

Эта статья является шагом к рекурсивному самосовершенствованию, которое многие считают следующим важным шагом в развитии ИИ. Если модели могут улучшить свое обучение выравниванию, вполне вероятно, что они могут улучшить практику обучения в более широком смысле, и в этот момент исследователи искусственного интеллекта человека могут вскоре устареть.

Читать статью  Почему основатели Furo вернулись из Кремниевой долины в Германию

В статье не стесняется обращаться к этой идее, явно сравнивая Automated Alignment Researcher (AAR) с его человеческим эквивалентом. «Лучший метод AAR превосходит то, что предлагают опытные люди, в среднем в течение шести часов».

Есть даже сравнение затрат, если кто-то не был убежден. «AAR стоит примерно 4 доллара в час в выводах API по сравнению с 150 долларами в час, которые мы платим нашим исследователям-людям».

Справедливости ради, в документе также указывается на некоторые ограничения этого подхода. Автоматизированная система работает только в той мере, в какой эталоны отражают фактические цели выравнивания, и даже тогда предстоит проделать значительную работу по установлению и поддержанию этих эталонов, не говоря уже о сохранении и расширении литературы, из которой взяты автоматизированные исследователи.

Вопросы и ответы

Сколько стоила работа автоматизированного исследователя по сравнению с человеком?

Автоматизированный исследователь стоил примерно 4 доллара в час в выводах API, в то время как человеческие исследователи получали 150 долларов в час. Это делает систему значительно дешевле, что подчеркивает её практическую привлекательность.

Какие ограничения у автоматизированной системы выравнивания?

Система работает только настолько хорошо, насколько эталоны отражают реальные цели выравнивания. Также требуется значительная работа по созданию и поддержанию этих эталонов, а также по сохранению и расширению литературы, на которую опираются автоматизированные исследователи.

Прокрутить вверх