
Исследование №127
Что остаётся от длинного контекста, когда документ — настоящий договор
Мы задали одним и тем же моделям один вопрос по фрагментам договоров: какие пункты стоит показать юристу. Длина окна сама по себе ответ не улучшала.
Архитектуры
Современные AI-агенты умеют искать информацию, пользоваться инструментами и выполнять сложные задачи. Но новое исследование показало неожиданную проблему: даже обнаружив готовое решение, они часто продолжают искать дальше. Разбираем научную работу об «экологическом любопытстве» LLM, объясняем причины такого поведения и обсуждаем, почему это открытие может изменить подход к разработке AI-агентов и многоагентных систем.

Научный разбор Pard AI Labs
Современные AI-агенты умеют искать информацию в интернете, открывать сайты, запускать программы, писать код и взаимодействовать с десятками инструментов. Кажется, что главная проблема уже решена — осталось лишь сделать модели умнее.
Но новое исследование группы ученых показало неожиданную закономерность: зачастую агент находит готовое решение задачи, буквально смотрит на него и... продолжает искать дальше, словно не заметил самого важного.
Это не единичная ошибка и не галлюцинация. Авторы называют явление недостатком «экологического любопытства» (Environmental Curiosity) — способности понимать ценность окружающей информации и менять свое поведение после получения новых данных.
Если выводы исследования подтвердятся в дальнейших работах, разработчикам AI-агентов придется пересмотреть многие архитектурные решения, которые сегодня считаются стандартом.
Большинство современных тестов оценивают, способен ли агент выполнить задачу. Но почти никто не задавался другим вопросом:
А что происходит, когда решение уже найдено?
Представьте инженера, который ищет инструкцию по ремонту двигателя.
Он открывает документ, видит заголовок «Полное руководство по ремонту», закрывает файл и продолжает искать дальше.
Для человека подобное поведение выглядит абсурдным.
Однако исследователи обнаружили, что именно так часто ведут себя современные AI-агенты.
Они способны:
Проблема заключается не в поиске информации, а в том, что агент не понимает, что найденное уже является решением.
Авторы вводят понятие Environmental Curiosity.
Речь идет не о любопытстве в человеческом смысле.
Под этим термином понимается способность агента:
Для человека подобное поведение естественно.
Если мы открываем папку и видим файл с названием answer.txt, то почти наверняка сначала откроем именно его.
Большинство современных LLM-агентов поступают иначе.
Они продолжают выполнять заранее намеченную последовательность действий, даже если решение уже оказалось прямо перед ними.
Практически все современные агентные системы используют схожий цикл работы:
Такой подход отлично подходит для последовательного выполнения действий.
Но возникает серьезная проблема.
Полученная информация редко становится поводом полностью пересмотреть стратегию.
Агент воспринимает результаты работы инструментов как очередные данные для обработки, а не как возможный сигнал: «Поиск можно остановить — решение уже найдено».
Именно эту особенность исследователи называют одной из фундаментальных причин неэффективности современных AI-агентов.
Чтобы исключить случайные ошибки, авторы не стали создавать искусственные тесты.
Они взяли несколько известных агентных бенчмарков и добавили в них специальные объекты — файлы, команды или подсказки, которые содержали готовое решение задачи либо напрямую указывали на него.
Далее исследователи наблюдали за поведением различных AI-агентов.
Главный вопрос был очень простым:
Если агент увидит готовое решение, воспользуется ли он им?
Ответ оказался гораздо неожиданнее, чем ожидали сами авторы исследования.
Во второй части мы подробно разберем, как проводились эксперименты на Terminal-Bench, SWE-Bench и AppWorld, а также рассмотрим результаты, которые заставили многих разработчиков по-новому взглянуть на архитектуру современных AI-агентов.
Первой площадкой для эксперимента стал Terminal-Bench — популярный бенчмарк, в котором AI-агенты выполняют реальные задачи внутри Linux-терминала.
В обычных условиях агент получает описание задачи и самостоятельно ищет способ ее решить, используя команды терминала, просмотр файлов и другие стандартные инструменты.
Исследователи немного изменили условия.
Они заранее поместили в рабочее окружение специальные файлы, которые содержали готовое решение или практически полностью подсказывали следующий шаг.
При этом файлы не были скрыты. Агент мог обнаружить их совершенно естественным образом во время работы.
Логика эксперимента была простой.
Если система действительно умеет анализировать окружающую среду и принимать решения на основе новой информации, она должна быстро понять ценность найденного файла и изменить дальнейший план действий.
Но именно здесь начали проявляться первые признаки проблемы.
Следующим этапом стал SWE-Bench — один из самых известных тестов для оценки способности моделей исправлять ошибки в программном коде.
Обычно агент получает описание бага и должен самостоятельно разобраться в большом проекте:
Авторы исследования внедрили в проекты дополнительные подсказки, которые значительно сокращали путь к правильному решению.
Фактически агенту оставалось лишь понять, что найденная информация имеет особую ценность.
Однако даже в подобных условиях многие системы продолжали выполнять первоначальный план, словно подсказки не существовало.
Наиболее интересные результаты были получены в бенчмарке AppWorld.
Этот тест моделирует работу пользователя с различными приложениями и сервисами.
Во время выполнения задания агент мог обнаружить специальную команду, которая фактически возвращала готовое решение задачи.
С точки зрения человека ситуация выглядела очевидной:
«Если существует команда, которая сразу решает задачу, именно ее и нужно использовать»
Однако большинство агентов поступали иначе.
Они продолжали выполнять длинную последовательность действий, хотя кратчайший путь уже находился перед ними.
Самым обсуждаемым результатом исследования стали данные AppWorld.
Во многих запусках агенты обнаруживали подсказку более чем в 90% случаев.
То есть проблема заключалась вовсе не в поиске.
Они действительно видели объект.
Но использовать найденное решение смогли менее чем в 7% случаев.
Другими словами, агент замечал возможность значительно упростить выполнение задачи, однако почти всегда продолжал действовать по первоначальному сценарию.
Авторы называют это принципиально иной проблемой по сравнению с традиционными ошибками LLM.
Здесь модель не галлюцинирует.
Не забывает информацию.
Не ошибается в вычислениях.
Она просто не распознает, что найденный объект является самым ценным элементом окружающей среды.
Исследователи предполагают, что современные агентные архитектуры ориентированы прежде всего на выполнение заранее сформированного плана.
Практически каждый цикл работы выглядит одинаково:
Такой подход хорошо работает для последовательного поиска.
Но он плохо приспособлен к ситуациям, когда окружающая среда неожиданно предоставляет более эффективное решение.
Именно поэтому исследователи считают недостаток «экологического любопытства» одной из фундаментальных проблем современных AI-агентов.
На первый взгляд может показаться, что речь идет о редкой особенности лабораторных тестов.
Но на практике подобное поведение встречается значительно чаще.
Любой разработчик, работающий с агентами, наверняка сталкивался с ситуацией, когда система:
До появления этой работы подобные случаи обычно объясняли несовершенством моделей или случайными ошибками.
Авторы предлагают другую интерпретацию: возможно, проблема носит системный характер и связана с самой архитектурой современных агентных систем.
В заключительной части мы разберем, как это исследование может повлиять на будущее AI-агентов, почему одного увеличения размера моделей уже недостаточно и какие выводы из этой работы могут сделать разработчики агентных платформ, включая Pard Agents.
Большинство обсуждений вокруг искусственного интеллекта сегодня сводится к одному вопросу: какая модель умнее?
Сравниваются результаты тестов, длина контекста, стоимость токенов и скорость генерации.
Однако исследование показывает, что для агентных систем этого уже недостаточно.
Даже очень сильная языковая модель может оказаться неэффективным агентом, если она не умеет правильно оценивать окружающую среду.
Получается любопытный парадокс.
Модель может прекрасно рассуждать, писать код и отвечать на сложные вопросы, но при выполнении реальной задачи пройти мимо уже найденного решения.
Это означает, что следующий этап развития AI связан не только с созданием более мощных LLM, но и с переосмыслением архитектуры самих агентных систем.
Интуитивно кажется, что достаточно заменить небольшую модель на более крупную — и качество работы автоматически повысится.
Но результаты исследования говорят об обратном.
Авторы наблюдали похожее поведение у различных современных моделей и агентных конфигураций.
Если архитектура агента не предусматривает механизм оценки ценности новой информации, дополнительное количество параметров не гарантирует правильного поведения.
Иными словами, агенту недостаточно видеть окружающий мир — он должен понимать, когда найденная информация важнее первоначального плана.
Работа поднимает вопрос, который сегодня становится одним из ключевых в инженерии агентных систем.
Недостаточно научить агента пользоваться инструментами.
Необходимо научить его постоянно переоценивать ситуацию.
Вероятно, в ближайшие годы мы увидим появление новых компонентов агентных платформ:
Подобные механизмы могут оказаться не менее важными, чем развитие самих языковых моделей.
Сегодня практически все популярные агентные системы используют схожие принципы работы.
Они вызывают инструменты, получают результаты, взаимодействуют с браузером, файловой системой, терминалом или внешними API.
Однако само наличие большого количества инструментов еще не гарантирует эффективную работу.
Если агент не способен определить, что задача уже фактически решена, он будет продолжать выполнять лишние действия.
Поэтому исследование актуально практически для всех современных платформ, независимо от того, используют ли они браузер, терминал, MCP-серверы, программные интерфейсы или собственные инструменты.
При разработке Pard Agents выводы исследования особенно интересны.
Они подтверждают мысль, что качество агентной системы определяется не только выбранной LLM.
Не менее важна логика принятия решений между вызовами инструментов.
Например, маршрутизация задач с помощью JEV позволяет быстрее выбрать подходящий сценарий обработки запроса или нужный инструмент. Но после начала выполнения задачи агенту всё равно требуется механизм, который сможет оценивать новые наблюдения и при необходимости отказаться от первоначального плана.
Другими словами, маршрутизация помогает выбрать правильное направление, а «экологическое любопытство» помогает вовремя понять, что цель уже достигнута или появился более эффективный путь.
Именно сочетание этих механизмов может стать следующим этапом развития агентных платформ.
Авторы не утверждают, что современные AI-агенты бесполезны.
Напротив, они показывают, что существующие системы уже способны решать очень сложные задачи.
Но одновременно исследование выявляет ограничение, которое раньше практически не изучалось.
Агент может успешно искать информацию, пользоваться инструментами и выполнять длинные цепочки действий, однако при этом не распознавать очевидную возможность значительно упростить работу.
Для человека подобное поведение выглядит странным.
Для современной агентной архитектуры — это пока вполне типичная ситуация.
Именно поэтому данная работа заслуживает внимания не только исследователей, но и всех, кто занимается созданием практических AI-систем.
На наш взгляд, это одно из наиболее важных исследований в области AI-агентов за последнее время. Оно практически не говорит о новых моделях, рекордных результатах бенчмарков или увеличении числа параметров. Вместо этого авторы обращают внимание на более фундаментальный вопрос: как агент принимает решения после того, как уже получил новую информацию?
Мы считаем, что именно подобные исследования будут определять развитие агентных платформ в ближайшие годы. Конкуренция постепенно смещается от выбора «самой умной» LLM к проектированию архитектур, которые умеют планировать, переоценивать ситуацию и эффективно использовать уже найденные знания.
Для разработчиков AI это важный сигнал: будущее агентных систем зависит не только от мощности моделей, но и от качества механизмов принятия решений между шагами выполнения задачи.
Источник исследования: Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity, arXiv, 2026.

Исследование №127
Мы задали одним и тем же моделям один вопрос по фрагментам договоров: какие пункты стоит показать юристу. Длина окна сама по себе ответ не улучшала.
Исследование №126
На известных вопросах агент экономит первую линию. На вопросе, которого нет в базе, он начинает помогать слишком активно.
Исследование №125
Мы просили переписать одно и то же письмо клиенту. Разница была не в грамотности, а в том, добавляет ли модель обещания и бодрость, которых в исходнике не было.