Anthropic: как научить ИИ-агентов работать днями без потери прогресса

Команда Anthropic опубликовала подробное исследование о том, как научить ИИ-агентов работать часами и днями, не теряя прогресс после каждой сессии. Проблема старая: каждый запуск модели — это история без памяти о предыдущем контексте. В рамках Claude Agent SDK инженеры нашли способ заставить агентов продолжать работу так, будто они один непрерывный процесс.

Почему агенты «забывают» проекты

Современные модели опираются на ограниченные контекстные окна. Когда задача выходит за их пределы — например, создание веб-приложения, — агент неизбежно теряет часть истории. Компакция контекста помогает, но не решает проблему полностью.

В экспериментах Claude допускал два типичных сбоя:

  1. Пытался сделать всё сразу, начинал реализацию большой фичи, заканчивал окно токенов и передавал управление следующей сессии в полуразрушенном состоянии.

  2. Преждевременно объявлял победу, видя часть готовых фич, и решал, что работа завершена.

Двухкомпонентное решение

Anthropic разложила задачу на две роли — и это сильно улучшило устойчивость:

1. Initializer agent.

Создаёт структуру проекта при первом запуске:

{
    "category": "functional",
    "description": "New chat button creates a fresh conversation",
    "steps": [
      "Navigate to main interface",
      "Click the 'New Chat' button",
      "Verify a new conversation is created",
      "Check that chat area shows welcome state",
      "Verify conversation appears in sidebar"
    ],
    "passes": false
  }

2. Coding agent.

Каждая следующая сессия:

Такой workflow позволяет следующему агенту «прийти на смену» и сразу понимать, что сделано, что сломано и что делать дальше.

Отдельное внимание уделили файлу с фичами в формате JSON. Агенту строго запрещено менять или удалять тесты: он может только переключать поле passes после успешной проверки. Такой подход оказался намного стабильнее использования Markdown — модель меньше ломает структуру.

Тестирование: как заставить ИИ проверять себя как человек

Без жёсткого запроса на end-to-end-тестирование агенты отмечали задачи как выполненные, даже если фича не работала полностью. Anthropic встроила браузерную автоматизацию через Puppeteer MCP: Claude запускает локальный сервер, открывает страницу, кликает кнопки, отправляет сообщения и получает ответы — как реальный пользователь.

Это значительно уменьшило число скрытых багов.

Как проходит типичная сессия

Запуск Coding Agent начинается с рутины, знакомой каждому разработчику:

Если базовые функции сломаны — агент сначала чинит их, а не продолжает разработку поверх ошибок.

Чего удалось добиться

Anthropic выделила четыре типичных сбоя и показала, как новый подход решает их:

Проблема

Решение Initializer

Решение Coding Agent

Агент объявляет проект завершённым

Создание списка всех фич

Выбор одной фичи и работа только над ней

Среда разрушается между сессиями

Начальный git-репо + прогресс-файл

Каждый запуск: чтение логов, базовое тестирование

Фичи отмечаются как готовые преждевременно

Жёсткая спецификация в JSON

Проверка через браузерную автоматизацию

Агент не знает, как запустить проект

init.sh

Использование скрипта при старте

Anthropic утверждает: такой подход существенно повышает надёжность и помогает моделям работать над крупными задачами почти бесконечно — пока остаются фичи, которые надо реализовать.

Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI-ассистентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!

@python_leader
28.11.2025 17:41 UTC
Первоисточник

Комментарии

@Dark_Makiavelli
28.11.2025 13:27 UTC
+1

Нужно еще понимать базовый принцип генерации ответов у ИИ-моделей: зависимость от настроек температуры. Как это работает: нейросеть выдает набор вероятностей (логитов) для следующего слова. Функция softmax преобразует эти логиты в распределение вероятностей. Параметр температуры (T) изменяет это распределение перед тем, как модель сделает выбор. Формула: softmax(logits / T). Какие бывают значения и что они означают: Низкая температура (T < 1, например, 0.2 - 0.5). Эффект: делает распределение вероятностей более «пикообразным», модель становится более уверенной и консервативной, текст более предсказуемый, детерминированный, фактологичный, модель выбирает только самые вероятные варианты, дает только проверенные, точные ответы. Высокая температура (T > 1, например, 1.2 - 1.8). Эффект: сглаживает распределение вероятностей, текст более случайный, креативный. Температура = 1: используется исходное распределение вероятностей без изменений. Это «стандартный» режим работы моделей, в большинстве дающий ложь из-за высокого параметра креатива и распределения возможностей ответа.

Для успеха нужно работать с температурой, правильным выводом нейронок, а для этого нужно работать с датасетами, машинным обучением, фильтрацией. Но как говорится если умеешь что-то, не делай это бесплатно. Если кто попросит - сделаю об этом пост.

@funca
28.11.2025 13:27 UTC
+3

Anthropic утверждает: такой подход существенно повышает надёжность и помогает моделям работать над крупными задачами почти бесконечно — пока остаются фичи, которые надо реализовать.

или пока на балансе не кончатся деньги.

@kost_org
29.11.2025 08:47 UTC
0

Делал подобное, агент сохранял все MR в виде текстового лога действий. Этот прием хорошо работает, когда план работы составляет одна модель, а выполняет - другая

@Frankenstine
29.11.2025 23:50 UTC
0

инженеры нашли способ заставить агентов продолжать работу так, будто они один непрерывный процесс

Моя твоя не понимать (ну или инженеры не смогли 🫠)