Безопасность и замедление

Всю прошлую неделю мир AI сотрясался от дискуссий вокруг безопасности AI — причем уже не гипотетической, со страшилками думеров вроде Юдковского “Нас всех убьет AI”, а на вполне практических примерах типа взлома Hugging Face агентами OpenAI, атаки ими же на RubyGems, аналогичных атак агентами Anthropic, причем картину оттеняли высказывания специалистов из компаний, начиная с громко уволившегося из Anthropic Джекоба Коксона.

В итоге Дарио Амодеи, основатель и глава Anthropic опубликовал очередное эссе “We Must Pace the Frontier” — уже из названия понятен призыв текста, в котором изложен план такого замедления. Дарио предлагает встраивать независимых экспертов-оценщиков в компании для проверки безопасности (Anthropic в одностороннем порядке уже выдает METR постоянный доступ сотрудников с рабочими местами в офисе, пропусками и правом публиковать выводы без согласования), координировать стандарты компаний демократических стран и глобально координировать усилия на уровне правительств.

Самое удивительное, что с ним согласились все лидеры AI — Сэм Альтман согласился и пообещал, что OpenAI также допустит независимых оценщиков, Илон Маск поддержал Дарио, Демис Хассабис согласился, правда, указал, что у DeepMind есть предложение по формированию единого отраслевого органа для оценки, и Сатья Наделла приветствовал “осознанное замедление”.

С замедлением есть одна проблема, и Дарио ее уже назвал — если лидеры гонки в виде американских Frontier-компаний замедлятся, то неизвестно, сделает ли это догоняющая группа в виде китайских компаний, которые уже сокращали отставание. Си Цзиньпинь на саммите BRICS призвал к зоне открытого AI, пообещав поддержку Китая в разработке LLM странам Глобального Юга.

Многие считают, что размах дискуссий вокруг этой проблемы — это такой маркетинг Anthropic для своего IPO. Размещение компании действительно обещает быть рекордным и позиционирование как наиболее ответственного разработчика AI читается ясно. Что, впрочем, не отменяет проблемы — даже если у вас паранойя, это не означает, что за вами не следят.

Я склонен добавить в число факторов общую культуру OpenAI — судя по разным эпизодам, ощущение ответственности у сотрудников компании вполне соответствует стереотипу ученого, то есть практически отсутствует в духе “Сначала взорвем всё, интересно же, что получится”.

Добавляется и политический аспект — громкая тема накануне и без того проблемных выборов в США и внешнеполитических событий охотно подхватывается политиками со всех сторон.

Я сильно сомневаюсь, что вожделенная многими встреча Трампа и Си Цзиньпиня через пару недель как-то повлияет на ту самую координацию, описанную Дарио Амодеи — рассчитывать, что Трамп вообще способен артикулировать какую-то позицию по вопросу вряд ли приходится (он уже заявил, что никаких рисков нет, погодите, потом он заявит, что это были самые прекрасные риски), так что Си просто не с кем договариваться. И слова Альтмана, что за такую договоренность можно было бы двум лидерами присудить Нобелевскую премию мира, выглядят очень примитивной попыткой побудить довольно престарелого человека хоть на что-то.

Рискну высказать мысль, что компании и правда могут сами замедлиться. Причем опасения, что китайцы в итоге догонят, не так уж абсолютны — пока ситуация выглядит так, что их успехи в значительной части зависят от дистилляции западных моделей, а дистилляция по умолчанию даёт потерю качества. Если при этом противодействовать дистилляции, то дистанция между frontier-моделями и китайскими может сократиться заметно, но не исчезнет совсем.