Кредитный конвейер 2.3: когда агент учится сам

ВЕСТНИК ФИНАНСОВЫХ ТЕХНОЛОГИЙ · ЦИКЛ «КРЕДИТНЫЙ КОНВЕЙЕР»
2026 · Июнь
Равиль Ахтямов
Равиль Ахтямов, к.э.н. Digital Economy Lab · digitaleconomylab.ru · Вестник финансовых технологий, июнь 2026

АННОТАЦИЯ

Переход от классического скоринга к мультиагентным LLM-системам породил разрыв между диагностикой и терапией. Статья «Кредитный конвейер 2.2» дала трёхуровневую систему метрик, локализующую ошибки и галлюцинации агентов. Настоящая работа замыкает эти метрики на автоматическую эволюцию агентов и объединяет в одной архитектуре два контура: внешний движок AEGIS (HarnessX) и внутренний цикл Self-Harness, в котором агент улучшает собственный харнес без внешнего «супер-агента». Получается конвейер, который не только фиксирует деградацию, но и самостоятельно исправляет её без остановки бизнес-процессов, сохраняя полную аудируемость в рамках 115-ФЗ и 152-ФЗ. Отдельный раздел помещает решение в общий ландшафт самоэволюционирующих агентов и сопоставляет его с актуальными исследовательскими системами.

Ключевые слова: LLM-агенты, самоэволюция, рантайм-харнес, HarnessX, AEGIS, Self-Harness, двухконтурная эволюция, кредитный конвейер, метрики качества, комплаенс, аудируемость.


Часть I. Диагностика и внешний контур эволюции (AEGIS / HarnessX)

1. Что останавливает кредитный конвейер сегодня

Современный кредитный конвейер на LLM-агентах уже умеет извлекать структурированные данные из комплектов документов, проверять контрагентов по стоп-факторам, рассчитывать PD и формировать проекты решений. Но как только меняется нормативная база, формат справки или рыночная практика, агент требует ручного вмешательства: кто-то должен переписать промпты, перенастроить цепочки вызовов и верифицировать, что андеррайтинг не сломался на миллионах заявок.

Это архаика. Статья «Кредитный конвейер 2.2» (Ахтямов, Вестник финансовых технологий, 2026) решила первую часть проблемы — диагностику. Трёхуровневая система метрик научилась отвечать на вопросы:

  • В каком именно шаге агент допустил галлюцинацию?
  • Какой примитив — верификатор ИНН, экстрактор суммы контракта, модуль комплаенс-проверки — стал узким горлышком?
  • Насколько стабильно агент сам исправляет свои ошибки (Recovery Rate)?

Но что делать с этим знанием? Ответ даёт архитектура HarnessX (arXiv:2606.14249) — это не новый агент, а «литейный цех», который автоматически собирает, адаптирует и эволюционирует рантайм-харнес агента, анализируя трассы его исполнения. Конвейер 2.3 рождается из союза этих двух идей: метрическая система становится целевой функцией, а HarnessX — движком терапии.

2. Трёхуровневая диагностика как фундамент

Напомним ключевые оси оценки из «Конвейера 2.2»:

  • Диалоговые метрики — релевантность ответа ассистента, полнота контекста, безопасность с точки зрения регулятора.
  • Метрики задачи — точность верификации ИНН/ОГРН, success rate этапа комплаенс-контроля, ложные срабатывания на санкционных списках.
  • Агентские метрики — Hallucination Rate (уровень галлюцинаций в юридически значимых полях), Recovery Rate (способность агента самостоятельно заметить и исправить ошибку до финального вердикта).

Эти метрики снимаются асинхронно через Kafka-топики и LangFuse, не затрагивая бизнес-логику. Конвейер 2.2 уже даёт непрерывный поток «трасс исполнения», размеченных по трём уровням. Именно эти размеченные трассы становятся горючим для следующего этапа.

Рис. 1. Трёхуровневая система метрик — диагностический фундамент конвейера.
Рис. 1. Трёхуровневая система метрик — диагностический фундамент конвейера. Размеченные трассы агрегируются в Kafka-поток и становятся входными данными для эволюционного движка.

3. HarnessX и движок AEGIS: от «логов» к автоматическому лечению

В чём главная инновация HarnessX? Вместо того чтобы рассматривать агента как монолитный промпт, он раскладывается на примитивы с алгеброй подстановок. Каждый примитив — это типизированный блок: «извлечь ИНН из скана», «проверить контрагента по перечню 115-ФЗ», «сопоставить статью баланса с шаблоном МСФО 9». Эти примитивы можно комбинировать и, главное, систематически заменять, не трогая остальную логику.

Движок AEGIS (Automated Evolution via Grounded Inference from Streams) работает в замкнутом цикле:

  1. Анализирует входящий поток трасс из Kafka.
  2. Выявляет примитив, на котором систематически падают метрики.
  3. Генерирует кандидата-примитива — улучшенный промпт или изменённую логику вызова инструментов.
  4. Отправляет кандидата на ретро-тестирование с использованием трёхуровневой системы метрик.
  5. При положительном исходе обновлённый примитив заменяет дефектный, замыкая контур «диагноз – лечение» без участия человека.

Такой подход даёт средний прирост производительности +14,5% на стандартизированных бенчмарках (ALFWorld, GAIA, WebShop, τ³-Bench, SWE-bench Verified) и до +44% в сценариях, где статические харнесы работали плохо.

4. Архитектура конвейера 2.3: нейрохирургия без остановки сердца

Связка метрической системы и HarnessX ложится на стек, проверенный в высоконагруженном финтехе:

  • Продакшн-агент (Triton Inference Server) обслуживает поток кредитных заявок. Каждый шаг порождает трассу в Kafka.
  • Модуль метрик (реализация «Конвейера 2.2») потребляет трассы и пересчитывает KPI в разрезе сегментов.
  • Evolution Engine (AEGIS) срабатывает при выходе метрики за порог, получает проблемный примитив и выборку «плохих» трасс.
  • Sandbox ретро-тестирования прогоняет кандидата на исторических данных из S3, сравнивает метрики.
  • Аудиторский гейт фиксирует причинно-следственную связь и разрешает деплой в Triton Model Repository.
Рис. 2. Архитектура одноконтурного варианта (внешний движок).
Рис. 2. Архитектура одноконтурного варианта (внешний движок). Замкнутый контур «диагноз → локализация → синтез → ретро-тест → деплой» работает без остановки бизнес-процесса; аудиторский след покрывает каждый шаг.

5. Жёсткий комплаенс: почему это легитимно

  • Каждая замена примитива — это детерминированная транзакция, порождённая конкретным нарушением KPI. Нет «чёрного ящика».
  • Изменения касаются только рантайм-харнеса, а не весов модели. Полный аудиторский след удовлетворяет требованиям 115-ФЗ и 152-ФЗ.
  • Персональные данные обезличены и не покидают защищённого периметра.

6. Сценарий: самоисцеление комплаенс-верификации

После публикации новой интерпретации Банка России примитив check_beneficiary_115FZ начинает давать ложные срабатывания. Метрики фиксируют рост Hallucination Rate и Recovery Rate. AEGIS получает триггер, генерирует обновлённый промпт, прогоняет его на 10 000 исторических заявок, убеждается в восстановлении метрик и деплоит с записью в журнал. Конвейер адаптировался за часы, а не недели.

Часть II. Двухконтурная эволюция: добавляем Self-Harness

7. Два контура эволюции: зачем добавлять Self-Harness

Внешний движок AEGIS целенаправленно улучшает харнес агента, анализируя трассы, но требует отдельной, часто более мощной модели-«инженера» и вносит задержку на коммуникацию. Метод Self-Harness (Zhang et al., 2026, arXiv:2606.09498), напротив, замыкает цикл внутри самого агента: он сам находит свои слабости, генерирует минимальные исправления и валидирует их регрессионным тестированием. Но его потолок ограничен способностями текущей LLM.

Для кредитного конвейера, работающего в реальном времени с жёсткими требованиями регулятора, оптимально объединить оба механизма в двухконтурную архитектуру:

  • Локальный контур (Self-Harness) — быстрая, модель-специфичная самокоррекция. Срабатывает автоматически при обнаружении повторяющихся ошибок на собственном потоке. Не требует внешнего вмешательства, минимальная задержка.
  • Глобальный контур (AEGIS) — стратегическая эволюция с привлечением более мощной аналитики или эксперта. Включается, когда локальный контур не справляется, либо когда требуется комплексная перестройка цепочки примитивов.

8. Архитектура двухконтурной эволюции

На рис. 3 показано, как Self-Harness встраивается в уже описанный стек Kafka, Triton, Sandbox и аудиторский гейт. Локальный цикл (зелёные блоки) выполняется внутри контура агента; глобальный (оранжевые) — асинхронно в эволюционном движке. Оба контура используют общую песочницу ретро-тестирования и проходят через единый аудиторский гейт, что сохраняет полную прослеживаемость изменений.

Рис. 3. Архитектура двухконтурной эволюции
Рис. 3. Архитектура двухконтурной эволюции: локальный Self-Harness (зелёный контур) и глобальный AEGIS (оранжевый контур). Оба замыкаются через общий Sandbox-ретротест и аудиторский гейт; деплой обновлённого примитива возвращается в Triton без остановки потока заявок.

9. Workflow двухконтурной эволюции: от ошибки до деплоя

  1. Сбор трасс: Kafka-стрим собирает все шаги агента — вызовы инструментов, ответы, промежуточные рассуждения.
  2. Модуль метрик: рассчитывает трёхуровневые показатели и обнаруживает рост, например, Hallucination Rate у агента верификации.
  3. Запуск локального контура: агент получает свои же обезличенные трассы за последний период и запускает Weakness Mining, идентифицируя, что ошибки концентрируются на определённом типе контрагентов.
  4. Harness Proposal: LLM агента генерирует несколько вариантов минимальных изменений в свой системный промпт или логику вызова API комплаенс-проверки.
  5. Proposal Validation: кандидаты автоматически прогоняются через тот же Sandbox на исторических заявках (ретро-тест). Проверяется, что метрики улучшились, а старые успешные кейсы не сломались.
  6. Аудиторский гейт: успешный кандидат с результатами тестов и обоснованием записывается в журнал эволюции и деплоится в Triton. Если за N попыток локальный контур не дал улучшений, срабатывает эскалация — включается глобальный AEGIS, который анализирует более широкий контекст и может предложить замену целого примитива.

10. Преимущества двухконтурной схемы для fintech-конвейера

  • Минимальная задержка: Self-Harness отрабатывает внутри окна обслуживания агента, не дожидаясь внешнего движка.
  • Модель-специфичность: улучшения точно соответствуют особенностям используемой LLM (Qwen, GLM и др.), что критично при импортозамещении.
  • Безопасность: встроенная валидация через регрессионное тестирование и обязательный аудиторский гейт предотвращают деградацию.
  • Масштабируемость: каждый агент эволюционирует автономно, снижая нагрузку на центральный AEGIS.
  • Комплаенс: журнал эволюции фиксирует, какой контур внёс изменение, на основе каких данных и с какими результатами тестирования — полная прослеживаемость для 115-ФЗ.

Часть III. Контекст, риски и развитие

11. Похожие системы: ландшафт самоэволюционирующих агентов

Предложенная двухконтурная архитектура опирается на быстро формирующуюся область самоэволюционирующих (self-evolving) и самоулучшающихся (self-improving) агентов. Её систематизируют два недавних обзора — Fang et al. (2025) и обзор «What, When, How, and Where to Evolve» (2025). Полезны две оси классификации: что именно эволюционирует (промпт → харнес → код/архитектура → веса модели) и где замыкается цикл улучшения (внутри самого агента или через внешний движок/мета-агент). Ниже — ключевые системы, релевантные кредитному конвейеру.

11.1. Оптимизация промптов и воркфлоу

  • GEPA (Agrawal et al., 2025) — рефлексивный эволюционный оптимизатор промптов: LLM анализирует собственные трассы на естественном языке, диагностирует ошибки и формирует Парето-фронт улучшающих правок; по заявленным результатам обходит RL-подход GRPO при кратно меньшем числе прогонов.
  • PromptBreeder (Fernando et al., 2023) — самореферентная эволюция промптов, при которой мутируют и сами промпты, и инструкции-мутаторы.
  • Reflexion (Shinn et al., 2023) — вербальное «обучение с подкреплением»: агент рефлексирует над неудачами и хранит выводы в эпизодической памяти, не меняя веса.

Эти методы изменяют только текстовый слой и потому хорошо аудируемы, но не затрагивают инструменты, память и логику управления.

11.2. Самоулучшающиеся харнесы (ближайшие аналоги)

  • Self-Harness (Zhang et al., 2026, Shanghai AI Lab) — агент улучшает собственный операционный харнес внутренним циклом «Weakness Mining → Harness Proposal → Proposal Validation», принимая правки только после регрессионного теста.
  • HarnessX / AEGIS (Darwin Agent Team, 2026) — «литейный цех» харнесов: типизированные примитивы с алгеброй подстановок эволюционируют внешним trace-driven движком.

Именно эти две работы образуют, соответственно, локальный и глобальный контуры предложенной архитектуры.

11.3. Автоматический дизайн и переписывание агента

  • ADAS / Meta Agent Search (Hu, Lu, Clune, 2024) — внешний мета-агент программирует новых агентов в коде, итеративно изобретая строительные блоки.
  • Gödel Agent (Yin et al., 2024) — самореферентный агент, рекурсивно изменяющий собственную логику.
  • Darwin Gödel Machine (Zhang et al., 2025) — открытая эволюция: архив самомодифицирующихся кодовых агентов с эмпирической проверкой каждой правки на бенчмарках.
  • EvoAgentX (Wang et al., 2025) — фреймворк автоматической эволюции мультиагентных воркфлоу.

Эти системы дают наибольшую свободу (меняют код и архитектуру), но требуют сильного контроля безопасности и слабо приспособлены к жёсткому регуляторному аудиту «из коробки».

Система Что эволюционирует Локус цикла Особенности / релевантность конвейеру
Reflexion (2023) Поведение в рантайме (вербальная память) Внутренний Саморефлексия по обратной связи без обновления весов.
PromptBreeder (2023) Промпты Самореферентный Эволюция промптов, мутирующих сами себя.
GEPA (2025) Промпты системы Внешний оптимизатор Рефлексивная эволюция с Парето-отбором; экономичнее RL.
ADAS / Meta Agent (2024) Код / архитектура агента Внешний мета-агент Мета-агент программирует новых агентов в коде.
Gödel Agent (2024) Собственный код и логика Внутренний (рекурсивно) Самореферентное рекурсивное самоулучшение.
Darwin Gödel Machine (2025) Код агента Внутренний + архив Открытая эволюция; эмпирическая валидация правок.
EvoAgentX (2025) Агентные воркфлоу Внешний фреймворк Автоматическая эволюция мультиагентных воркфлоу.
Self-Harness (2026) Харнес (промпт, инструменты, контроль) Внутренний (сам агент) Weakness Mining → Proposal → Validation; локальный контур.
HarnessX / AEGIS (2026) Примитивы харнеса Внешний движок Алгебра подстановок, trace-driven; глобальный контур.
Двухконтурная 2.3 (предлагается) Харнес — на обоих уровнях Внутренний + внешний Self-Harness (быстро) + AEGIS (стратегически) + обязательный аудиторский гейт под 115-ФЗ/152-ФЗ.
Табл. 1. Сопоставление смежных систем самоэволюции агентов с предложенной двухконтурной архитектурой.
Рис. 4. Карта позиционирования смежных систем по двум осям
Рис. 4. Карта позиционирования смежных систем по двум осям: что эволюционирует (промпт → харнес → код) и где замыкается цикл (внутренний / внешний). Предложенная двухконтурная архитектура (золотая область) занимает уровень харнеса, объединяя внутренний и внешний контуры.

На этой карте видно отличие предложенного решения. Системы оптимизации промптов аудируемы, но ограничены текстовым слоем; системы автоматического дизайна кода (ADAS, Gödel-семейство) максимально свободны, но трудно сертифицируемы. Self-Harness и HarnessX работают на «золотой середине» — уровне харнеса, — но порознь: один силён скоростью внутренней самокоррекции, другой — глубиной внешней стратегической эволюции. Двухконтурная архитектура объединяет оба контура и добавляет обязательный аудиторский гейт, которого академические системы, как правило, не предусматривают, — именно это делает её пригодной для эксплуатации под надзором регулятора.

12. Риски самоэволюции и ограничения

Риск «мисэволюции». Самообучающиеся агенты несут риск деградации качества или безопасности в ходе автономных изменений. Обзор Fang et al. (2025) формулирует три принципа: Endure — сохранение безопасности, Excel — недопущение деградации текущих способностей, Evolve — собственно улучшение. В предложенной архитектуре они операционализированы регрессионным ретро-тестом в песочнице и обязательным аудиторским гейтом: ни одно изменение не достигает продакшна без подтверждённого улучшения метрик и записи в журнал эволюции.

Помимо этого следует учитывать естественные ограничения подхода: качество эволюции наследует качество разметки трасс и «золотых наборов»; внутренний контур ограничен потолком текущей LLM, а внешний — стоимостью и задержкой более мощной аналитики; для надёжной оценки агентских метрик (например, устойчивости к сдвигу распределения) нужна объёмная историческая выборка. Эти ограничения определяют состав дорожной карты.

13. Дорожная карта и план развития

Первоочередные шаги внедрения:

  • Формализовать примитивы: декомпозировать текущие харнесы на атомарные блоки.
  • Развернуть ретро-среду: на исторических данных с теми же метрическими панелями.
  • Внедрить журнал эволюции: с полным аудиторским следом и стоп-краны для высокорисковых операций.

За горизонтом двухконтурной архитектуры — пять стратегических направлений, переводящих систему из реактивной адаптации в проактивное управление рисками.

13.1. Проактивный комплаенс-мониторинг на основе предиктивных моделей

Современный конвейер реагирует на уже случившиеся отклонения метрик. Следующий шаг — предиктивный комплаенс: модели машинного обучения анализируют поток заявок, поведение контрагентов и слабые сигналы из внешних источников (изменения в реестрах, новостной фон, динамика законодательных инициатив) и предсказывают риск нарушения 115-ФЗ ещё до совершения операции. При достижении пороговой вероятности AEGIS может автоматически инициировать адаптацию харнеса — например, временно включить дополнительный уровень верификации бенефициаров для сегмента с повышенным прогнозным риском. Все решения сохраняются в журнале аудита.

13.2. Автоматическое дообучение агентов на ошибочных эпизодах (LoRA fine-tuning)

Сейчас оба контура адаптируют только харнес (промпты и цепочки вызовов), не трогая веса языковой модели. Наиболее устойчивое улучшение требует тонкой настройки самой LLM на критических ошибках, выявленных в проде. Low-Rank Adaptation (LoRA) — легковесный метод дообучения, не требующий перетренировки всей модели. Трассы с ошибками анонимизируются и формируют датасет; LoRA-адаптеры тренируются в sandbox-среде, проходят ретро-тестирование и при улучшении метрик деплоятся вместе с обновлённым харнесом. Журнал эволюции фиксирует, какие примеры послужили причиной дообучения, что удовлетворяет требованиям explainable AI.

13.3. Расширение контура 152-ФЗ: автоматическое маскирование персональных данных

По мере роста взаимодействий с клиентами через чат-интерфейсы возникает риск «утечки» ПДн в диалоговых логах. План включает автоматическое маскирование ПДн на лету непосредственно в Kafka-стриме трасс: специализированный NLP-модуль (например, fine-tuned NER-модель) обнаруживает ФИО, паспортные данные, адреса, ИНН и телефонные номера и заменяет их токенами-псевдонимами до попадания трассы в постоянное хранилище. Это полностью выполняет требования 152-ФЗ и позволяет легально использовать диалоговые данные для улучшения метрик и дообучения.

13.4. Мультимодальные метрики для изображений документов

Конвейер всё чаще работает со сканами паспортов, уставов, балансов. Для оценки агентов, обрабатывающих изображения, нужны мультимодальные метрики: точность распознавания ключевых зон (серия/номер паспорта, печати, подписи), устойчивость к поворотам и зашумлению, кросс-модальная согласованность (совпадает ли текст из скана с машиночитаемой зоной). Мультимодальный контур сможет адаптировать не только промпты, но и параметры предобработки изображений, основываясь на потоке визуальных трасс.

13.5. Федеративное обучение метрик качества

Банки редко могут централизовать данные для обучения метрик из-за регуляторных ограничений и коммерческой тайны. Федеративное обучение позволяет тренировать модель метрик (например, классификатор галлюцинаций) распределённо: она остаётся внутри контура каждого участника, а обновления агрегируются без передачи сырых данных. Это создаёт основу отраслевого консорциума по оценке качества кредитных агентов, не нарушая 152-ФЗ и банковскую тайну. Журнал эволюции содержит хеши агрегированных обновлений, обеспечивая прозрачность без раскрытия чувствительной информации.

Заключение

Итог. Кредитный конвейер 2.3 — это не замена людей, а ликвидация самой опасной рутины: бесконечного ручного латания промптов в ответ на подвижки регулирования. Объединяя внешний движок AEGIS и внутренний Self-Harness в двухконтурную архитектуру, система сама диагностирует свои слабости, предлагает точечную терапию на уровне харнеса и проводит каждое изменение через ретро-тест и аудиторский гейт. На фоне общего ландшафта самоэволюционирующих агентов решение отличает прицельный выбор уровня харнеса и встроенный комплаенс-контур, а человек выполняет роль стратегического контролёра.

Литература

  1. Ахтямов Р.Э. Кредитный конвейер 2.2: система метрик качества для LLM-агентов // Вестник финансовых технологий. 2026. Т. 2, вып. 2.
  2. Chen T., Lu S., Zhao K. et al. (Darwin Agent Team). HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry. 2026. arXiv:2606.14249.
  3. Zhang H., Zhang S., Li K. et al. Self-Harness: Harnesses That Improve Themselves. 2026. arXiv:2606.09498.
  4. Agrawal L.A., Tan S., Soylu D. et al. GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning. 2025. arXiv:2507.19457.
  5. Fernando C., Banarse D., Michalewski H. et al. PromptBreeder: Self-Referential Self-Improvement via Prompt Evolution. 2023. arXiv:2309.16797.
  6. Shinn N., Cassano F., Gopinath A. et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023. arXiv:2303.11366.
  7. Hu S., Lu C., Clune J. Automated Design of Agentic Systems. ICLR 2025. arXiv:2408.08435.
  8. Yin X., Wang X., Pan L. et al. Gödel Agent: A Self-Referential Framework for Recursive Self-Improvement. 2024. arXiv:2410.04444.
  9. Zhang J., Hu S., Lu C., Lange R., Clune J. Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents. 2025. arXiv:2505.22954.
  10. Wang Y., Liu S., Fang J., Meng Z. EvoAgentX: An Automated Framework for Evolving Agentic Workflows. 2025. arXiv:2507.03616.
  11. Fang J., Peng Y., Zhang X. et al. A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems. 2025. arXiv:2508.07407.
  12. A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence. 2025. arXiv:2507.21046.
  13. Федеральный закон от 07.08.2001 № 115-ФЗ «О противодействии легализации (отмыванию) доходов, полученных преступным путём, и финансированию терроризма».
  14. Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных».

Статьи цикла «Кредитный конвейер»