Большие языковые модели, на которых работают современные ИИ-чат-боты, сами научились разбирать предложения по ролям слов — кто действует, что делает и с кем. Похожим образом функционирует и человеческое мышление. Работу опубликовали на сервере препринтов arXiv специалисты Йельского университета, Университета Джонса Хопкинса, Нью-Йоркского университета и Microsoft Research.
Традиционно интеллект описывали как работу с символами, например, словами в предложении или знаками в логической формуле, которые складываются в упорядоченные конструкции. Современные нейросети устроены иначе и хранят информацию в виде длинных наборов чисел, где никакой видимой структуры нет. Тем не менее именно они лучше всего справляются с языком, математикой, логикой и программированием. Ученые предположили, что символьная структура в нейросетях всё же есть, просто она спрятана внутри этих чисел.
Чтобы проверить догадку, ученые попытались разгадать «шифр», которым нейросеть записывает прочитанный текст. Они предположили, что в этом шифре каждое слово хранится вместе со своей ролью в предложении, и составили по такому принципу собственную формулу, настроив ее на множестве примеров. Затем исследователи шифровали фразы своей формулой и подсовывали результат вместо настоящего «продукта мышления» нейросети. Если такую подделку удавалось прочитать так же, как оригинал, значит, ученые правильно угадали, как устроен шифр. Так они проверили несколько небольших нейросетей и семь крупных языковых моделей, включая Gemma-3, Llama-3.1, Qwen3 и GPT-OSS. Догадка подтвердилась во всех случаях.
Подробнее всего ученые изучили модель GPT-OSS, которой давали задачи по арифметике, логике, выполнению программного кода и грамматике (например, перевести предложение в страдательный залог или сделать из него вопрос). С подмененными представлениями модель решала задачи почти так же хорошо, как в обычном режиме, а наибольшее расхождение составило 2,36% в арифметике.
Найденную структуру исследователям удалось использовать для точечного управления моделью. Например, в предложении «Шпион помог умному поэту» они переносили слово «умный» из роли определения к дополнению в роль определения к подлежащему, и модель начинала вести себя так, будто получила фразу «Умный шпион помог поэту». В среднем такие вмешательства срабатывали в 90% случаев. Кроме того, метод правильно обрабатывал сочетания слов и ролей, которых не видел при обучении, — по словам авторов, это значит, что модели действительно связывают элементы и их позиции по единым правилам, а не запоминают каждое сочетание отдельно.
Ученые считают, что нейросети воспроизводят символьные системы приближенно, а не точно. На это, в частности, указывает любопытный результат: вспомогательная модель, которую обучили восстанавливать предложение по внутреннему представлению GPT-OSS, справлялась с задачей лучше, если получала не настоящие данные нейросети, а их «очищенную» формульную версию. В одном из случаев точность выросла с 71% до 96%. Авторы допускают, что похожим образом может работать и человеческий мозг, но подчеркивают, что без отдельных исследований на данных мозговой активности делать такие выводы рано.

