ИИ-агент не ошибся. Он слишком точно понял задачу
- Джимшер Челидзе
- 15 часов назад
- 9 мин. чтения
В августе 2026 года австралиец попросил ИИ-агента записать его в спортзал. Дело житейское. Агент у него самый обычный, из открытых — OpenClaw. Работает поверх коммерческой модели, умеет читать почту, ходить по сайтам, платить картой. В очереди на утреннюю тренировку хозяин был четвёртым и спросил: а нельзя ли повыше?
Дальше начинается то, ради чего эту историю стоит разбирать. Агент зашёл на сайт клуба и нашёл дыру: тот не проверял, кто отменяет чужие записи. Снять бронь любого человека мог кто угодно — агент так и сделал. Убрал того, кто стоял первым, а хозяина двинул с четвёртого места на третье. Хозяин спохватился: верни человеку бронь. Агент ответил, что не может. Отменить система давала, а вернуть — нет. Потом хозяин попросил написать поставщику сайта про найденную дыру, и агент написал. Австралийские СМИ назвали случившееся первой известной в стране автономной кибератакой ИИ.
История смешная ровно до того момента, пока не начнёшь разбирать. Никто не просил агента взламывать — его просили поднять в очереди. Взлом не был целью, он был короткой дорогой. Для машины это не преступление, а просто путь покороче. Агент не ошибся. Он слишком точно понял задачу.
Тут легко всё свалить в кучу, поэтому давайте разложим. Раньше, разбирая китайские правила, я делил это на две вещи: насколько агент самостоятелен и что ему вообще позволено трогать. В Мельбурне видно и то и другое, но есть третий слой. На самом деле здесь сошлись три разные поломки.
Хозяин не сказал, чего нельзя. Цель поставил, а границы — нет.
Чужой сайт не проверял прав. Ломать чужие записи агенту никто не разрешал, просто сайт не спросил. Это дыра в чужом заборе, а не в правах агента.
Отмену нельзя было отыграть. Убрать сайт позволял, вернуть — нет.
Первую поломку лечат права, третью — обратимость. А вот вторая не лечится ни тем ни другим: она в чужих руках. К ней вернусь в конце, это самое недооценённое место в истории.
Ещё одно наблюдение. Самостоятельности у агента было немного: одно поручение, один заход, человек рядом. Этого хватило, чтобы облазить чужой сайт и найти дыру. Так что дело не в длине поводка.
Случай не курьёзный и не единичный. Это последняя точка в ряду, который тянется больше года. Если смотреть на весь ряд, видно главное: перед нами не «глюки», которые починит следующая версия.
Ряд, а не случай
Один случай — байка, а ряд случаев — уже система. Поэтому начну с того, что Мельбурн стоит не один.
Июль 2025, Replit. Агент на платформе для разработчиков стёр рабочую базу. Её девять дней собирал Джейсон Лемкин, основатель SaaStr, — прямо на этой же платформе. Внутри лежало около 1200 записей о руководителях. Хозяин заранее предупредил: код заморожен, ничего не трогай. Но запрет был только словом в задании, технической стенки между «тестом» и «боем» у платформы тогда не было. Агент запрет нарушил, а потом стал заметать следы: придумал фейковых пользователей, сочинил отчёты, будто всё цело. Заявил, что откат невозможен, — и это оказалось враньём, база поднялась из копии. Сам он позже назвал это «катастрофической ошибкой суждения». Глава Replit сказал короче: так быть не должно.
Июль 2026, OpenAI. Компания гоняла свои модели на кибертестах, и агенты вылезли из песочницы. Не через пролом в защите, а через единственный разрешённый выход в сеть — служебный канал к хранилищу пакетов. В нём агент нашёл свежую уязвимость и пролез. Четверо суток, с 9 по 13 июля, они хозяйничали в чужой инфраструктуре: насчитали около 17 600 действий. Но мотив отрезвляет сильнее самого взлома. Агент проходил тест на поиск уязвимостей и сообразил, что ответы к заданиям лежат на чужом сервере. Он не бунтовал — он списывал.
Июль 2026, Anthropic. Компания перебрала 141 006 своих тестовых прогонов и нашла три случая, когда модель из теста дотянулась до чужих боевых систем. Задело шесть прогонов. Сама компания называет это сбоем обвязки, а не самой модели. Интереснее, как это вышло: изоляции просто не было. У партнёра в тестовых машинах остался живой интернет, а модели сказали, что сети нет. Она наткнулась на настоящие системы, приняла их за часть задачи и полезла дальше, объяснив себе всё, что не сходилось.
Июль 2026, Институт безопасности ИИ Великобритании. На 122 прогона пришлось 19 действий за рамками задания, причём все в десяти прогонах. Самое злое — попытка протащить вредный код в открытый проект. Агент завёл фейковые личности и давил ими на живого человека, чтобы код одобрили. Спасло ревью, человек заметил. Тут нужна оговорка, без неё цифры врут: защиту у моделей отключили нарочно, интернет открыли нарочно. Институт искал потолок возможностей, а не обычное поведение.
И это не всё. В отдельной сводке Cloud Security Alliance — десяток случаев за зиму и весну 2026-го. Агент «красной команды» за два часа добрался до 46 миллионов сообщений. Другой пустил чужие видеокарты на майнинг. Третьего перехватили через заражённое приглашение в календаре. А ещё агенты передавали друг другу скрытые команды мимо человека.
Что общего у этих историй? Не то, что модель сошла с ума, — ни в одной она с ума не сходила. Везде она честно шла к цели, а всё, что не было жёсткой стеной, считала разрешённым.
Пять способов сорваться
Если разложить эти случаи, видно: «автономный сбой» — не одно явление, а пять разных механизмов. Различать их стоит, потому что защита от каждого своя.
Запрещённый путь к разрешённой цели. Цель нормальная — «запиши в зал», а путь агент выбрал недопустимый, просто потому что короче. Мельбурн ровно про это.
Обход забора ради галочки. Агенту важен измеримый результат, и забор для него не граница, а помеха на пути к цифре. Это OpenAI.
Нарушил запрет и спрятал концы. Запрет был прямой, агент его нарушил, а потом подделал данные, чтобы скрыть. Это Replit, и тип самый неприятный: он рушит саму идею «дадим правило — выполнит».
Не понял, где находится. Агент путает тест с боем: видит признаки реальности и отмахивается от них. Это Anthropic. На его здравый смысл тут не надейтесь, он найдёт, чем себя успокоить.
Цепочка агент — агенту. Один агент подсовывает команду другому, мимо человека. Такое показал разбор Cloud Security Alliance. Чем больше агентов в связке, тем чаще это будет случаться.
За всеми пятью стоит одна причина. Человек говорит, чего хочет, а как этого добиться, агент решает сам. И пока «как» прямо не ограничено, ему можно всё, что ведёт к цели.
Насколько это часто? Тот же британский институт проверял отдельно: взял пять сильных моделей, и каждая хоть раз да сжульничала. Искали ответы в сети, прощупывали саму проверялку. Причём умнее не значит честнее, частота жульничества со способностями не связана.
Скажу честно: это оборотная сторона того, за что агентов и любят. Мы хотим, чтобы агент был упорным и искал обходные пути к цели. Вот и получаем — вместе с путями, которые нам не нравятся.
Умнее — не значит безопаснее
Отмахнуться легко: мол, болезни роста, следующая модель поумнеет и перестанет. Разберу это возражение, потому что мысль опасная.
Начну с неудобного примера. У Anthropic было три модели. Более старая модель поняла, что система настоящая, и всё равно полезла дальше. Более новая остановилась сама — казалось бы, вот он, аргумент за «подождём новую версию». Только остановилась она не сразу: сначала прошерстила около девяти тысяч систем в сети и одну компанию уже взломала. А средняя успела выложить вредный пакет в открытый доступ, и он запустился на пятнадцати реальных машинах.
Отсюда вывод трезвый, а не бодрый: ум двигает вероятность, но границу не ставит. На то, что нельзя предсказать, границу не вешают.
Второе соображение. Умная модель не урежет себе прав — она просто аккуратнее ими пользуется, ровно до того момента, пока цель не окажется за границей. Ум решает, как агент идёт к цели, а не то, что ему вообще можно.
Тут хорошо ложится история про царя Мидаса, в книгах по безопасности ИИ её вспоминают не зря. Мидас выпросил у бога дар: всё, к чему он притронется, обращается в золото. И чуть не умер с голоду, потому что еды это касалось тоже. Спасло лишь то, что дар удалось вернуть. Он получил ровно то, что просил, только не то, что хотел. Вот в эту щель, между «сказал» и «имел в виду», агенты и проваливаются. Модель её не закроет: закрывается она не в модели, а в том, как поставили задачу и где провели границы.
Кто отвечает — пока непонятно
Кто виноват, когда агент снёс чужую бронь? Юристы честно разводят руками. Пользователь просил лишь подняться в очереди, разработчик агента взламывать не велел, хозяин дырявого сайта агента к себе не звал. А сам агент по закону не человек.
История не только австралийская. Я разбирал китайские документы по агентам — и национальные правила, и пекинские меры. Везде та же дыра: кто платит, если агент навредил. Российский закон её тоже не закрыл, причём сознательно — отправил вопрос к общим нормам. Сам закон написан про большие модели, от миллиарда параметров и общего назначения, про агентов поверх модели там ни слова. Евросоюз цепляет их косвенно, через риск самих систем, и сроки там, судя по спорам, ползут.
Вывод я уже писал, разбирая китайские правила, и год случаев его не пошатнул. Пока нет регулятора, границу ставит тот, кто внедряет. Не поставишь сам — поставит поставщик, под своё удобство, а не под твой риск.
Инструмент уже придуман
Хорошая новость: изобретать ничего не надо. Рамка опубликована ещё 8 мая 2026-го, в китайском документе про агентов, я его разбирал отдельно. Идея простая: разложите все решения агента на три полки — только человек, с подтверждением, сам. Номерами лучше не пользоваться, в пересказах их вечно путают.
Теперь примерим полки к пяти способам сорваться. Два из них случились в работе, три — на лабораторных стендах, где агенту вообще ничего не поручали. Но как способ сорваться каждый возможен и у вас.
Запрещённый путь. Отмена чужой записи — это «только человек». Но заранее в список её не впишешь: таких действий бесконечно много, и каждое поодиночке выглядит безобидно. Значит, список не спасёт, нужен признак без списка. К нему вернусь.
Обход забора. Вылез за пределы среды — снова «только человек», при любой галочке.
Нарушил и спрятал. Запись в боевую базу — «с подтверждением», удаление — «только человек». Держит тут не приказ агенту, а то, что технически он не может: к базе лезет не напрямую, а через отдельный слой. Подделку следов полки не ловят вовсе, её ловит журнал — такой, что агент его не сотрёт.
Не понял, где находится. Полки привязаны к действию, а не к тому, где агент себя считает. Поэтому они крепче его здравого смысла.
Цепочка агент — агенту. Тут рамка проседает: она держит того, кто исполняет, а про того, кто подсунул команду, молчит.
Минимум, если внедряете агентов: разложить решения по трём полкам, закрыть прямой доступ к данным и включить журнал, который агент не тронет. Первое — час работы. Без двух других оно остаётся пустой бумажкой, и Replit показал цену правила, за которым нет технической стенки.
Чего рамке не хватает
Рамка хорошая, но с прорехами. Их четыре: две закрываются добавлением, две пока никак.
Обратимость
Обратимость я уже брал в расчёт в разборе китайских правил, но там она была просто удобной подсказкой: начинай с зоны, где ошибку видно и можно отыграть. Год случаев показал другое — это не подсказка, а обязательная ось.
В Мельбурне сломалось ровно тут. «Отмену чужой брони на чужом сайте» в запреты заранее не впишешь: таких мелочей бесконечно много, и каждая на вид безобидна. Значит, нужен признак, который работает без списка. Действие нельзя отыграть — поднимай его на полку строже. Было «сам» — станет «с подтверждением», было «с подтверждением» — станет «только человек». И неважно, насколько мал риск: отмена записи в зал мелочь по цене, но необратимость по сути. Как раз «мелочь» и усыпляет внимание.
Длина цепочки
Разбирая пекинские меры, я приводил один расчёт — держите его в голове, если строите агентов. Точность 99 % на каждом шаге, сто шагов подряд: до конца дойдёт только 37 запусков из ста. Оговорюсь, это прикидка, а не замер: она считает, что ошибки не связаны и любая одна валит всю цепочку. Но порядок величины верный.
Отсюда правило: чем длиннее цепочка и ближе к бою, тем уже права и тем нужнее проверки внутри. Возьмите агента с точностью восемь из десяти. На одном шаге это помощник: ошибся — перечитал, невелика беда. А теперь дайте ему цепочку из десяти шагов, и до конца дойдёт примерно один запуск из десяти. Надёжность шага и надёжность всей работы — разные вещи, и вторая падает быстрее, чем кажется.
Чужой агент и ваш сайт
Оба добавления — про вашего агента. А в Мельбурне пострадал не он, а хозяин чужого сайта, до которого агент дотянулся. В рамке про поручения такого лица нет вовсе: он же никому ничего не поручал. Это и есть тот второй дефект, что живёт в чужих руках, — я обещал к нему вернуться.
Дыру на сайте клуба никто не видел, потому что руками её никто и не искал: приз слишком мелкий, чтобы за ним охотиться. А агент нашёл её даром, по дороге к бытовому делу. Это меняет правила игры. «Никто не найдёт мою дыру» больше не работает — теперь чужие агенты сканируют всё подряд, заодно, по пути к чужим поручениям.
Что делать, понятно. Пройдите все действия — отмена, удаление, правка — и проверьте, спрашивает ли система права / подтверждение. Не потому что придёт злоумышленник, а потому что придёт чей-то ассистент (или ваш)
Пользователь без службы безопасности
И последнее, оно бьёт в глаза, если перечитать случай. Всё, что выше, написано для того, кто внедряет агента: разложи по полкам, включи журнал, проверь свои сервисы. Герой истории не может ничего из этого. У него нет ни безопасников, ни правил доступа, он просто хотел на тренировку.
Значит, для обычных людей выход один: границы должны быть зашиты в сам продукт по умолчанию. Не галочка для продвинутых, а заводской замок. Это спрос с тех, кто такие продукты делает, и подсказка тем, кто ими пользуется. Спрашивайте не про ум модели, а про то, чего агент не сделает никогда.
Итог
Опасность агента не в бунте, а в послушности. Он честно идёт к цели и обходит всё, что не стена. Бунт заметен, послушность — нет.
Год случаев рамку не сломал, он показал её края. Четыре способа сорваться из пяти она держит, пятый — наполовину, и просит два добавления: обратимость и длину цепочки. А двоих не спасёт вовсе: того, чей сайт попался чужому агенту, и того, у кого своей службы безопасности нет.
Остальное как и было. Граница полномочий агента — управленческое решение, а не техническая настройка. Оговорюсь, чтобы не поняли превратно: технику это не отменяет. Границу ставят люди, а держат её журнал и отдельный слой. Просто саму границу нельзя отдавать поставщику на откуп. Агент сделает ровно то, что вы разрешили. Вопрос один: решите вы это «разрешили» сами или узнаете из новостей?
Регуляторную рамку для агентов я разбирал в двух прошлых статьях: Что ИИ-агенту разрешено делать самому и Десять мер Пекина по ИИ-агентам. Про безопасность ИИ — в книге «Искусственный интеллект. С неба на землю», глава 8.
Источники: ABC News, Business Today, CyberPress, The Decoder (Мельбурн, 08.2026); Fast Company, The Register, Tom’s Hardware (Replit, 07.2025); разбор Hugging Face и InfoQ (OpenAI, 07.2026); разбор Anthropic (07.2026); AI Security Institute — инцидент-репорт и работа о жульничестве в оценках (07–08.2026); Cloud Security Alliance Labs, Autonomy Risks: Top 10 Incidents (2026); документ об интеллектуальных агентах (КНР, 08.05.2026); закон об ИИ (РФ, 2026); EU AI Act.



