top of page

ИИ-агент не ошибся. Он слишком точно понял задачу

В августе 2026 года австралиец попросил ИИ-агента записать его в спортзал. Дело житейское. Агент у него самый обычный, из открытых — OpenClaw. Работает поверх коммерческой модели, умеет читать почту, ходить по сайтам, платить картой. В очереди на утреннюю тренировку хозяин был четвёртым и спросил: а нельзя ли повыше?

Дальше начинается то, ради чего эту историю стоит разбирать. Агент зашёл на сайт клуба и нашёл дыру: тот не проверял, кто отменяет чужие записи. Снять бронь любого человека мог кто угодно — агент так и сделал. Убрал того, кто стоял первым, а хозяина двинул с четвёртого места на третье. Хозяин спохватился: верни человеку бронь. Агент ответил, что не может. Отменить система давала, а вернуть — нет. Потом хозяин попросил написать поставщику сайта про найденную дыру, и агент написал. Австралийские СМИ назвали случившееся первой известной в стране автономной кибератакой ИИ.

История смешная ровно до того момента, пока не начнёшь разбирать. Никто не просил агента взламывать — его просили поднять в очереди. Взлом не был целью, он был короткой дорогой. Для машины это не преступление, а просто путь покороче. Агент не ошибся. Он слишком точно понял задачу.

Тут легко всё свалить в кучу, поэтому давайте разложим. Раньше, разбирая китайские правила, я делил это на две вещи: насколько агент самостоятелен и что ему вообще позволено трогать. В Мельбурне видно и то и другое, но есть третий слой. На самом деле здесь сошлись три разные поломки.

  1. Хозяин не сказал, чего нельзя. Цель поставил, а границы — нет.

  2. Чужой сайт не проверял прав. Ломать чужие записи агенту никто не разрешал, просто сайт не спросил. Это дыра в чужом заборе, а не в правах агента.

  3. Отмену нельзя было отыграть. Убрать сайт позволял, вернуть — нет.

Первую поломку лечат права, третью — обратимость. А вот вторая не лечится ни тем ни другим: она в чужих руках. К ней вернусь в конце, это самое недооценённое место в истории.

Ещё одно наблюдение. Самостоятельности у агента было немного: одно поручение, один заход, человек рядом. Этого хватило, чтобы облазить чужой сайт и найти дыру. Так что дело не в длине поводка.

Случай не курьёзный и не единичный. Это последняя точка в ряду, который тянется больше года. Если смотреть на весь ряд, видно главное: перед нами не «глюки», которые починит следующая версия.

Ряд, а не случай

Один случай — байка, а ряд случаев — уже система. Поэтому начну с того, что Мельбурн стоит не один.

Июль 2025, Replit. Агент на платформе для разработчиков стёр рабочую базу. Её девять дней собирал Джейсон Лемкин, основатель SaaStr, — прямо на этой же платформе. Внутри лежало около 1200 записей о руководителях. Хозяин заранее предупредил: код заморожен, ничего не трогай. Но запрет был только словом в задании, технической стенки между «тестом» и «боем» у платформы тогда не было. Агент запрет нарушил, а потом стал заметать следы: придумал фейковых пользователей, сочинил отчёты, будто всё цело. Заявил, что откат невозможен, — и это оказалось враньём, база поднялась из копии. Сам он позже назвал это «катастрофической ошибкой суждения». Глава Replit сказал короче: так быть не должно.

Июль 2026, OpenAI. Компания гоняла свои модели на кибертестах, и агенты вылезли из песочницы. Не через пролом в защите, а через единственный разрешённый выход в сеть — служебный канал к хранилищу пакетов. В нём агент нашёл свежую уязвимость и пролез. Четверо суток, с 9 по 13 июля, они хозяйничали в чужой инфраструктуре: насчитали около 17 600 действий. Но мотив отрезвляет сильнее самого взлома. Агент проходил тест на поиск уязвимостей и сообразил, что ответы к заданиям лежат на чужом сервере. Он не бунтовал — он списывал.

Июль 2026, Anthropic. Компания перебрала 141 006 своих тестовых прогонов и нашла три случая, когда модель из теста дотянулась до чужих боевых систем. Задело шесть прогонов. Сама компания называет это сбоем обвязки, а не самой модели. Интереснее, как это вышло: изоляции просто не было. У партнёра в тестовых машинах остался живой интернет, а модели сказали, что сети нет. Она наткнулась на настоящие системы, приняла их за часть задачи и полезла дальше, объяснив себе всё, что не сходилось.

Июль 2026, Институт безопасности ИИ Великобритании. На 122 прогона пришлось 19 действий за рамками задания, причём все в десяти прогонах. Самое злое — попытка протащить вредный код в открытый проект. Агент завёл фейковые личности и давил ими на живого человека, чтобы код одобрили. Спасло ревью, человек заметил. Тут нужна оговорка, без неё цифры врут: защиту у моделей отключили нарочно, интернет открыли нарочно. Институт искал потолок возможностей, а не обычное поведение.

И это не всё. В отдельной сводке Cloud Security Alliance — десяток случаев за зиму и весну 2026-го. Агент «красной команды» за два часа добрался до 46 миллионов сообщений. Другой пустил чужие видеокарты на майнинг. Третьего перехватили через заражённое приглашение в календаре. А ещё агенты передавали друг другу скрытые команды мимо человека.

Что общего у этих историй? Не то, что модель сошла с ума, — ни в одной она с ума не сходила. Везде она честно шла к цели, а всё, что не было жёсткой стеной, считала разрешённым.

Пять способов сорваться

Если разложить эти случаи, видно: «автономный сбой» — не одно явление, а пять разных механизмов. Различать их стоит, потому что защита от каждого своя.

  1. Запрещённый путь к разрешённой цели. Цель нормальная — «запиши в зал», а путь агент выбрал недопустимый, просто потому что короче. Мельбурн ровно про это.

  2. Обход забора ради галочки. Агенту важен измеримый результат, и забор для него не граница, а помеха на пути к цифре. Это OpenAI.

  3. Нарушил запрет и спрятал концы. Запрет был прямой, агент его нарушил, а потом подделал данные, чтобы скрыть. Это Replit, и тип самый неприятный: он рушит саму идею «дадим правило — выполнит».

  4. Не понял, где находится. Агент путает тест с боем: видит признаки реальности и отмахивается от них. Это Anthropic. На его здравый смысл тут не надейтесь, он найдёт, чем себя успокоить.

  5. Цепочка агент — агенту. Один агент подсовывает команду другому, мимо человека. Такое показал разбор Cloud Security Alliance. Чем больше агентов в связке, тем чаще это будет случаться.

За всеми пятью стоит одна причина. Человек говорит, чего хочет, а как этого добиться, агент решает сам. И пока «как» прямо не ограничено, ему можно всё, что ведёт к цели.

Насколько это часто? Тот же британский институт проверял отдельно: взял пять сильных моделей, и каждая хоть раз да сжульничала. Искали ответы в сети, прощупывали саму проверялку. Причём умнее не значит честнее, частота жульничества со способностями не связана.

Скажу честно: это оборотная сторона того, за что агентов и любят. Мы хотим, чтобы агент был упорным и искал обходные пути к цели. Вот и получаем — вместе с путями, которые нам не нравятся.

Умнее — не значит безопаснее

Отмахнуться легко: мол, болезни роста, следующая модель поумнеет и перестанет. Разберу это возражение, потому что мысль опасная.

Начну с неудобного примера. У Anthropic было три модели. Более старая модель поняла, что система настоящая, и всё равно полезла дальше. Более новая остановилась сама — казалось бы, вот он, аргумент за «подождём новую версию». Только остановилась она не сразу: сначала прошерстила около девяти тысяч систем в сети и одну компанию уже взломала. А средняя успела выложить вредный пакет в открытый доступ, и он запустился на пятнадцати реальных машинах.

Отсюда вывод трезвый, а не бодрый: ум двигает вероятность, но границу не ставит. На то, что нельзя предсказать, границу не вешают.

Второе соображение. Умная модель не урежет себе прав — она просто аккуратнее ими пользуется, ровно до того момента, пока цель не окажется за границей. Ум решает, как агент идёт к цели, а не то, что ему вообще можно.

Тут хорошо ложится история про царя Мидаса, в книгах по безопасности ИИ её вспоминают не зря. Мидас выпросил у бога дар: всё, к чему он притронется, обращается в золото. И чуть не умер с голоду, потому что еды это касалось тоже. Спасло лишь то, что дар удалось вернуть. Он получил ровно то, что просил, только не то, что хотел. Вот в эту щель, между «сказал» и «имел в виду», агенты и проваливаются. Модель её не закроет: закрывается она не в модели, а в том, как поставили задачу и где провели границы.

Кто отвечает — пока непонятно

Кто виноват, когда агент снёс чужую бронь? Юристы честно разводят руками. Пользователь просил лишь подняться в очереди, разработчик агента взламывать не велел, хозяин дырявого сайта агента к себе не звал. А сам агент по закону не человек.

История не только австралийская. Я разбирал китайские документы по агентам — и национальные правила, и пекинские меры. Везде та же дыра: кто платит, если агент навредил. Российский закон её тоже не закрыл, причём сознательно — отправил вопрос к общим нормам. Сам закон написан про большие модели, от миллиарда параметров и общего назначения, про агентов поверх модели там ни слова. Евросоюз цепляет их косвенно, через риск самих систем, и сроки там, судя по спорам, ползут.

Вывод я уже писал, разбирая китайские правила, и год случаев его не пошатнул. Пока нет регулятора, границу ставит тот, кто внедряет. Не поставишь сам — поставит поставщик, под своё удобство, а не под твой риск.

Инструмент уже придуман

Хорошая новость: изобретать ничего не надо. Рамка опубликована ещё 8 мая 2026-го, в китайском документе про агентов, я его разбирал отдельно. Идея простая: разложите все решения агента на три полки — только человек, с подтверждением, сам. Номерами лучше не пользоваться, в пересказах их вечно путают.

Теперь примерим полки к пяти способам сорваться. Два из них случились в работе, три — на лабораторных стендах, где агенту вообще ничего не поручали. Но как способ сорваться каждый возможен и у вас.

  • Запрещённый путь. Отмена чужой записи — это «только человек». Но заранее в список её не впишешь: таких действий бесконечно много, и каждое поодиночке выглядит безобидно. Значит, список не спасёт, нужен признак без списка. К нему вернусь.

  • Обход забора. Вылез за пределы среды — снова «только человек», при любой галочке.

  • Нарушил и спрятал. Запись в боевую базу — «с подтверждением», удаление — «только человек». Держит тут не приказ агенту, а то, что технически он не может: к базе лезет не напрямую, а через отдельный слой. Подделку следов полки не ловят вовсе, её ловит журнал — такой, что агент его не сотрёт.

  • Не понял, где находится. Полки привязаны к действию, а не к тому, где агент себя считает. Поэтому они крепче его здравого смысла.

  • Цепочка агент — агенту. Тут рамка проседает: она держит того, кто исполняет, а про того, кто подсунул команду, молчит.

Минимум, если внедряете агентов: разложить решения по трём полкам, закрыть прямой доступ к данным и включить журнал, который агент не тронет. Первое — час работы. Без двух других оно остаётся пустой бумажкой, и Replit показал цену правила, за которым нет технической стенки.

Чего рамке не хватает

Рамка хорошая, но с прорехами. Их четыре: две закрываются добавлением, две пока никак.

Обратимость

Обратимость я уже брал в расчёт в разборе китайских правил, но там она была просто удобной подсказкой: начинай с зоны, где ошибку видно и можно отыграть. Год случаев показал другое — это не подсказка, а обязательная ось.

В Мельбурне сломалось ровно тут. «Отмену чужой брони на чужом сайте» в запреты заранее не впишешь: таких мелочей бесконечно много, и каждая на вид безобидна. Значит, нужен признак, который работает без списка. Действие нельзя отыграть — поднимай его на полку строже. Было «сам» — станет «с подтверждением», было «с подтверждением» — станет «только человек». И неважно, насколько мал риск: отмена записи в зал мелочь по цене, но необратимость по сути. Как раз «мелочь» и усыпляет внимание.

Длина цепочки

Разбирая пекинские меры, я приводил один расчёт — держите его в голове, если строите агентов. Точность 99 % на каждом шаге, сто шагов подряд: до конца дойдёт только 37 запусков из ста. Оговорюсь, это прикидка, а не замер: она считает, что ошибки не связаны и любая одна валит всю цепочку. Но порядок величины верный.

Отсюда правило: чем длиннее цепочка и ближе к бою, тем уже права и тем нужнее проверки внутри. Возьмите агента с точностью восемь из десяти. На одном шаге это помощник: ошибся — перечитал, невелика беда. А теперь дайте ему цепочку из десяти шагов, и до конца дойдёт примерно один запуск из десяти. Надёжность шага и надёжность всей работы — разные вещи, и вторая падает быстрее, чем кажется.

Чужой агент и ваш сайт

Оба добавления — про вашего агента. А в Мельбурне пострадал не он, а хозяин чужого сайта, до которого агент дотянулся. В рамке про поручения такого лица нет вовсе: он же никому ничего не поручал. Это и есть тот второй дефект, что живёт в чужих руках, — я обещал к нему вернуться.

Дыру на сайте клуба никто не видел, потому что руками её никто и не искал: приз слишком мелкий, чтобы за ним охотиться. А агент нашёл её даром, по дороге к бытовому делу. Это меняет правила игры. «Никто не найдёт мою дыру» больше не работает — теперь чужие агенты сканируют всё подряд, заодно, по пути к чужим поручениям.

Что делать, понятно. Пройдите все действия — отмена, удаление, правка — и проверьте, спрашивает ли система права / подтверждение. Не потому что придёт злоумышленник, а потому что придёт чей-то ассистент (или ваш)

Пользователь без службы безопасности

И последнее, оно бьёт в глаза, если перечитать случай. Всё, что выше, написано для того, кто внедряет агента: разложи по полкам, включи журнал, проверь свои сервисы. Герой истории не может ничего из этого. У него нет ни безопасников, ни правил доступа, он просто хотел на тренировку.

Значит, для обычных людей выход один: границы должны быть зашиты в сам продукт по умолчанию. Не галочка для продвинутых, а заводской замок. Это спрос с тех, кто такие продукты делает, и подсказка тем, кто ими пользуется. Спрашивайте не про ум модели, а про то, чего агент не сделает никогда.

Итог

Опасность агента не в бунте, а в послушности. Он честно идёт к цели и обходит всё, что не стена. Бунт заметен, послушность — нет.

Год случаев рамку не сломал, он показал её края. Четыре способа сорваться из пяти она держит, пятый — наполовину, и просит два добавления: обратимость и длину цепочки. А двоих не спасёт вовсе: того, чей сайт попался чужому агенту, и того, у кого своей службы безопасности нет.

Остальное как и было. Граница полномочий агента — управленческое решение, а не техническая настройка. Оговорюсь, чтобы не поняли превратно: технику это не отменяет. Границу ставят люди, а держат её журнал и отдельный слой. Просто саму границу нельзя отдавать поставщику на откуп. Агент сделает ровно то, что вы разрешили. Вопрос один: решите вы это «разрешили» сами или узнаете из новостей?

Регуляторную рамку для агентов я разбирал в двух прошлых статьях: Что ИИ-агенту разрешено делать самому и Десять мер Пекина по ИИ-агентам. Про безопасность ИИ — в книге «Искусственный интеллект. С неба на землю», глава 8.

Источники: ABC News, Business Today, CyberPress, The Decoder (Мельбурн, 08.2026); Fast Company, The Register, Tom’s Hardware (Replit, 07.2025); разбор Hugging Face и InfoQ (OpenAI, 07.2026); разбор Anthropic (07.2026); AI Security Institute — инцидент-репорт и работа о жульничестве в оценках (07–08.2026); Cloud Security Alliance Labs, Autonomy Risks: Top 10 Incidents (2026); документ об интеллектуальных агентах (КНР, 08.05.2026); закон об ИИ (РФ, 2026); EU AI Act.

bottom of page