Описанность, а не сложность
Есть наблюдение, которое рано или поздно делает каждый, кто работает с ИИ не по выходным. Модель разбирает за час задачу, над которой вы просидели бы месяц. А следом не может собрать выписку из вашего внутреннего документа - то, с чем справится вчерашний стажёр.
В чем причина нестабильности ИИ?
Мы по привычке раскладываем задачи по сложности: вот простая, вот трудная. И ждём, что инструмент уверенно отработает простые и споткнётся на трудной, как человек.
Но в работе с ИИ логика другая: сколько похожего написано людьми и доступно в текстах, особенно в обучающем наборе данных. Эту шкалу я называю описанностью.
Олимпиадная задача сложна, но описана тысячи раз: у неё есть жанр, канонические приёмы решения и заранее известный критерий правильного ответа. Создание вашего регламента простая задача, но она не описана нигде: этот документ адаптирован под ваш бизнес и пользоваться им будут три человека для внутреннего пользования.

Три слоя новизны
Спор о том, справляется ли ИИ с новым, бессмыслен, пока не разведены три разные вещи, которые все называют новизной.
Первый слой - новый пример в известном жанре. Правила заданы, формат ответа задан, критерий правильности задан. Здесь модель работает уверенно.
Второй слой - новая комбинация описанного: перенести идею из одной отрасли в другую. У модели все отрасли сразу лежат в базе знаний, и она подберёт аналогию между чужими друг другу областями быстрее любого специалиста.
Третий слой - новое знание: вопрос, который до вас никто не ставил, и заранее неизвестно, каким должен быть правильный ответ. Сама модель этот вопрос просто не задаст. Но она справится под пошаговым руководством человека и исполнит шаги. Но вопрос и критерий правильности в этом случае держит человек, а не она. Это свойство конструкции, а не недостаток текущей версии.

Самый честный пример третьего слоя
Модель закрыла открытую математическую проблему из списка Эрдёша - ту, что стояла нерешённой десятилетиями. Сильный результат.
Посмотрите только, кто что сделал. Вопрос поставил Эрдёш восемьдесят лет назад. Задача пришла из собранного математиками списка открытых проблем Эрдёша, уже в чёткой формулировке. Ответ проверили другие математики, а потом ещё и улучшили. Модель прошла путь от готового вопроса до проверяемого ответа, и на этом отрезке она обошла людей.
Ставить вопрос и решать, важен ли он, ей никто не поручал. В этом граница между вторым слоем и третьим: решить поставленную задачу и поставить задачу, которой не было, - разные работы.

Но ведь тесты на новизну уже проходят
Резонное возражение: "Есть тесты, собранные из задач, которых модель не видела, и в этом году она их решает с результатом выше человеческого"
Возражение снимается тем же разведением слоёв. Такой тест - новые экземпляры в известном жанре: правила преобразований заданы, формат ответа задан, критерий правильности задан заранее. Это первый слой, и его закрытие тезису не противоречит. Про третий слой ни один тест ничего не скажет: составить его невозможно, ведь заранее неизвестно, что считать правильным ответом.
Практический критерий
На практике многие часто сталкиваются с простым наблюдением. Когда у тебя есть четкое видение и понимание, что ты хочешь и условно сам в голове все построил, то с ИИ отлично работать и он может показаться альтернативой человеку. Но когда ты сам не знаешь что хочешь или устал и не готов продумать задачу, то результат будет посредственным.
И здесь можно сформулировать простое правило.
Прежде чем отдавать задачу, посмотрите, сколько похожего написано и лежит в открытом доступе. Много - отдавайте: результат будет сильным независимо от сложности и точности продумывания. Нет ничего - получите правдоподобную пустоту, и простота задачи вас не спасёт.
Для задач, где речь о настоящей новизне, критерий другой: существует ли заранее известный способ проверить правильность ответа и похожие логические способы решения задачи. Если такой способ есть - работайте, инструмент справится и с трудным. Если нет - это ваша территория. Машина там упаковщик, а не автор. И ключевой критерий тут - насколько ясно и четко вы сами представляете конечный результат задачи и можете сформулировать что хотите.
Редкий процесс, который модель всё же решает
Возьмите редкий внутренний процесс, которого нет ни в одном источнике, но который сводится к известному классу задач: к задаче о назначениях, о сопоставлении, к типовому договору. Он выглядит как «мой уникальный случай, модель тут бессильна». А модель справляется, и хорошо.
Потому что модель читала не про ваш процесс. Она читала про класс задач, к которому он сводится и нашла взаимосвязи и похожесть. Ось проходит между тем, что укладывается в описанное, и тем, что не укладывается, - а вовсе не между «моим» и «чужим». Поэтому первое, что стоит сделать с задачей, - попробовать свести её к классу. Сведение удалось - качество ответа вырастает кратно, и вы не меняли в модели ни строчки.
Кто закрывает разрыв
Разрыв между описанным и неописанным есть и у человека: в незнакомой области мы тоже беспомощны. Разница в том, кто его закрывает.
Человек закрывает сам: задает себе вопрос, читает, пробует, ошибается, спрашивает - и выходит на приемлемый уровень в области, о которой не знал ничего. А затем будет пользоваться этим навыком.
У модели путей два, и оба лежат снаружи неё. Первый - дообучение: его делают чужие руки, раз в несколько месяцев, централизованно и не на ваших данных. Второй путь - вы: формулируете, что хотите, даёте данные, создаете рабочую инфраструктуру, проверяете результат. Он работает здесь и сейчас, и на нём стоит вся практическая польза от ИИ сегодня.
У второго пути есть цена, о которой не пишут в пресс-релизах: настройку приходится повторять каждый раз заново. Сама ИИ-модель ничего не запоминает, все это костыли с помощью внешних файлов. Отлаженный сценарий сам не переезжает на соседнюю задачу.
При чём тут общий интеллект
Соберём. Сила инструмента пропорциональна тому, сколько про задачу написали до вас люди. Сдвинуть эту ось изнутри он не может: веса после обучения не меняются. Разрыв закрывается либо заводом раз в несколько месяцев, либо человеком - каждый раз вручную.
Общий интеллект по любому разумному определению - способность браться за то, чего не видел и под что не был спроектирован, доводить задачу до результата в меняющихся условиях, а также самостоятельно формировать устоявшийся навык и использовать его в будущем. Сегодняшний инструмент последнего не умеет: разрыв за него закрывает человек.
Конечно, доказательства, что общий интеллект на текущих технологиях невозможен, нет ни у кого; я описываю, как инструмент ведёт себя сегодня, и почему разговоры о скором общем интеллекте плохо вяжутся с этим поведением.
И условие, при котором я признаю, что ошибся. Система сама поставила вопрос, сама решила, что он важен, и специалисты области приняли её результат как новое знание, а не как хорошо решённую поставленную задачу. Появится такое - тезис придётся переписывать, и я перепишу.



