2026 · Июнь
АННОТАЦИЯ
Переход от классического скоринга к мультиагентным LLM-системам породил разрыв между диагностикой и терапией. Статья «Кредитный конвейер 2.2» дала трёхуровневую систему метрик, локализующую ошибки и галлюцинации агентов. Настоящая работа замыкает эти метрики на автоматическую эволюцию агентов и объединяет в одной архитектуре два контура: внешний движок AEGIS (HarnessX) и внутренний цикл Self-Harness, в котором агент улучшает собственный харнес без внешнего «супер-агента». Получается конвейер, который не только фиксирует деградацию, но и самостоятельно исправляет её без остановки бизнес-процессов, сохраняя полную аудируемость в рамках 115-ФЗ и 152-ФЗ. Отдельный раздел помещает решение в общий ландшафт самоэволюционирующих агентов и сопоставляет его с актуальными исследовательскими системами.
Ключевые слова: LLM-агенты, самоэволюция, рантайм-харнес, HarnessX, AEGIS, Self-Harness, двухконтурная эволюция, кредитный конвейер, метрики качества, комплаенс, аудируемость.
Часть I. Диагностика и внешний контур эволюции (AEGIS / HarnessX)
1. Что останавливает кредитный конвейер сегодня
Современный кредитный конвейер на LLM-агентах уже умеет извлекать структурированные данные из комплектов документов, проверять контрагентов по стоп-факторам, рассчитывать PD и формировать проекты решений. Но как только меняется нормативная база, формат справки или рыночная практика, агент требует ручного вмешательства: кто-то должен переписать промпты, перенастроить цепочки вызовов и верифицировать, что андеррайтинг не сломался на миллионах заявок.
Это архаика. Статья «Кредитный конвейер 2.2» (Ахтямов, Вестник финансовых технологий, 2026) решила первую часть проблемы — диагностику. Трёхуровневая система метрик научилась отвечать на вопросы:
- В каком именно шаге агент допустил галлюцинацию?
- Какой примитив — верификатор ИНН, экстрактор суммы контракта, модуль комплаенс-проверки — стал узким горлышком?
- Насколько стабильно агент сам исправляет свои ошибки (Recovery Rate)?
Но что делать с этим знанием? Ответ даёт архитектура HarnessX (arXiv:2606.14249) — это не новый агент, а «литейный цех», который автоматически собирает, адаптирует и эволюционирует рантайм-харнес агента, анализируя трассы его исполнения. Конвейер 2.3 рождается из союза этих двух идей: метрическая система становится целевой функцией, а HarnessX — движком терапии.
2. Трёхуровневая диагностика как фундамент
Напомним ключевые оси оценки из «Конвейера 2.2»:
- Диалоговые метрики — релевантность ответа ассистента, полнота контекста, безопасность с точки зрения регулятора.
- Метрики задачи — точность верификации ИНН/ОГРН, success rate этапа комплаенс-контроля, ложные срабатывания на санкционных списках.
- Агентские метрики — Hallucination Rate (уровень галлюцинаций в юридически значимых полях), Recovery Rate (способность агента самостоятельно заметить и исправить ошибку до финального вердикта).
Эти метрики снимаются асинхронно через Kafka-топики и LangFuse, не затрагивая бизнес-логику. Конвейер 2.2 уже даёт непрерывный поток «трасс исполнения», размеченных по трём уровням. Именно эти размеченные трассы становятся горючим для следующего этапа.
3. HarnessX и движок AEGIS: от «логов» к автоматическому лечению
В чём главная инновация HarnessX? Вместо того чтобы рассматривать агента как монолитный промпт, он раскладывается на примитивы с алгеброй подстановок. Каждый примитив — это типизированный блок: «извлечь ИНН из скана», «проверить контрагента по перечню 115-ФЗ», «сопоставить статью баланса с шаблоном МСФО 9». Эти примитивы можно комбинировать и, главное, систематически заменять, не трогая остальную логику.
Движок AEGIS (Automated Evolution via Grounded Inference from Streams) работает в замкнутом цикле:
- Анализирует входящий поток трасс из Kafka.
- Выявляет примитив, на котором систематически падают метрики.
- Генерирует кандидата-примитива — улучшенный промпт или изменённую логику вызова инструментов.
- Отправляет кандидата на ретро-тестирование с использованием трёхуровневой системы метрик.
- При положительном исходе обновлённый примитив заменяет дефектный, замыкая контур «диагноз – лечение» без участия человека.
Такой подход даёт средний прирост производительности +14,5% на стандартизированных бенчмарках (ALFWorld, GAIA, WebShop, τ³-Bench, SWE-bench Verified) и до +44% в сценариях, где статические харнесы работали плохо.
4. Архитектура конвейера 2.3: нейрохирургия без остановки сердца
Связка метрической системы и HarnessX ложится на стек, проверенный в высоконагруженном финтехе:
- Продакшн-агент (Triton Inference Server) обслуживает поток кредитных заявок. Каждый шаг порождает трассу в Kafka.
- Модуль метрик (реализация «Конвейера 2.2») потребляет трассы и пересчитывает KPI в разрезе сегментов.
- Evolution Engine (AEGIS) срабатывает при выходе метрики за порог, получает проблемный примитив и выборку «плохих» трасс.
- Sandbox ретро-тестирования прогоняет кандидата на исторических данных из S3, сравнивает метрики.
- Аудиторский гейт фиксирует причинно-следственную связь и разрешает деплой в Triton Model Repository.
5. Жёсткий комплаенс: почему это легитимно
- Каждая замена примитива — это детерминированная транзакция, порождённая конкретным нарушением KPI. Нет «чёрного ящика».
- Изменения касаются только рантайм-харнеса, а не весов модели. Полный аудиторский след удовлетворяет требованиям 115-ФЗ и 152-ФЗ.
- Персональные данные обезличены и не покидают защищённого периметра.
6. Сценарий: самоисцеление комплаенс-верификации
После публикации новой интерпретации Банка России примитив check_beneficiary_115FZ начинает давать ложные срабатывания. Метрики фиксируют рост Hallucination Rate и Recovery Rate. AEGIS получает триггер, генерирует обновлённый промпт, прогоняет его на 10 000 исторических заявок, убеждается в восстановлении метрик и деплоит с записью в журнал. Конвейер адаптировался за часы, а не недели.
Часть II. Двухконтурная эволюция: добавляем Self-Harness
7. Два контура эволюции: зачем добавлять Self-Harness
Внешний движок AEGIS целенаправленно улучшает харнес агента, анализируя трассы, но требует отдельной, часто более мощной модели-«инженера» и вносит задержку на коммуникацию. Метод Self-Harness (Zhang et al., 2026, arXiv:2606.09498), напротив, замыкает цикл внутри самого агента: он сам находит свои слабости, генерирует минимальные исправления и валидирует их регрессионным тестированием. Но его потолок ограничен способностями текущей LLM.
Для кредитного конвейера, работающего в реальном времени с жёсткими требованиями регулятора, оптимально объединить оба механизма в двухконтурную архитектуру:
- Локальный контур (Self-Harness) — быстрая, модель-специфичная самокоррекция. Срабатывает автоматически при обнаружении повторяющихся ошибок на собственном потоке. Не требует внешнего вмешательства, минимальная задержка.
- Глобальный контур (AEGIS) — стратегическая эволюция с привлечением более мощной аналитики или эксперта. Включается, когда локальный контур не справляется, либо когда требуется комплексная перестройка цепочки примитивов.
8. Архитектура двухконтурной эволюции
На рис. 3 показано, как Self-Harness встраивается в уже описанный стек Kafka, Triton, Sandbox и аудиторский гейт. Локальный цикл (зелёные блоки) выполняется внутри контура агента; глобальный (оранжевые) — асинхронно в эволюционном движке. Оба контура используют общую песочницу ретро-тестирования и проходят через единый аудиторский гейт, что сохраняет полную прослеживаемость изменений.
9. Workflow двухконтурной эволюции: от ошибки до деплоя
- Сбор трасс: Kafka-стрим собирает все шаги агента — вызовы инструментов, ответы, промежуточные рассуждения.
- Модуль метрик: рассчитывает трёхуровневые показатели и обнаруживает рост, например, Hallucination Rate у агента верификации.
- Запуск локального контура: агент получает свои же обезличенные трассы за последний период и запускает Weakness Mining, идентифицируя, что ошибки концентрируются на определённом типе контрагентов.
- Harness Proposal: LLM агента генерирует несколько вариантов минимальных изменений в свой системный промпт или логику вызова API комплаенс-проверки.
- Proposal Validation: кандидаты автоматически прогоняются через тот же Sandbox на исторических заявках (ретро-тест). Проверяется, что метрики улучшились, а старые успешные кейсы не сломались.
- Аудиторский гейт: успешный кандидат с результатами тестов и обоснованием записывается в журнал эволюции и деплоится в Triton. Если за N попыток локальный контур не дал улучшений, срабатывает эскалация — включается глобальный AEGIS, который анализирует более широкий контекст и может предложить замену целого примитива.
10. Преимущества двухконтурной схемы для fintech-конвейера
- Минимальная задержка: Self-Harness отрабатывает внутри окна обслуживания агента, не дожидаясь внешнего движка.
- Модель-специфичность: улучшения точно соответствуют особенностям используемой LLM (Qwen, GLM и др.), что критично при импортозамещении.
- Безопасность: встроенная валидация через регрессионное тестирование и обязательный аудиторский гейт предотвращают деградацию.
- Масштабируемость: каждый агент эволюционирует автономно, снижая нагрузку на центральный AEGIS.
- Комплаенс: журнал эволюции фиксирует, какой контур внёс изменение, на основе каких данных и с какими результатами тестирования — полная прослеживаемость для 115-ФЗ.
Часть III. Контекст, риски и развитие
11. Похожие системы: ландшафт самоэволюционирующих агентов
Предложенная двухконтурная архитектура опирается на быстро формирующуюся область самоэволюционирующих (self-evolving) и самоулучшающихся (self-improving) агентов. Её систематизируют два недавних обзора — Fang et al. (2025) и обзор «What, When, How, and Where to Evolve» (2025). Полезны две оси классификации: что именно эволюционирует (промпт → харнес → код/архитектура → веса модели) и где замыкается цикл улучшения (внутри самого агента или через внешний движок/мета-агент). Ниже — ключевые системы, релевантные кредитному конвейеру.
11.1. Оптимизация промптов и воркфлоу
- GEPA (Agrawal et al., 2025) — рефлексивный эволюционный оптимизатор промптов: LLM анализирует собственные трассы на естественном языке, диагностирует ошибки и формирует Парето-фронт улучшающих правок; по заявленным результатам обходит RL-подход GRPO при кратно меньшем числе прогонов.
- PromptBreeder (Fernando et al., 2023) — самореферентная эволюция промптов, при которой мутируют и сами промпты, и инструкции-мутаторы.
- Reflexion (Shinn et al., 2023) — вербальное «обучение с подкреплением»: агент рефлексирует над неудачами и хранит выводы в эпизодической памяти, не меняя веса.
Эти методы изменяют только текстовый слой и потому хорошо аудируемы, но не затрагивают инструменты, память и логику управления.
11.2. Самоулучшающиеся харнесы (ближайшие аналоги)
- Self-Harness (Zhang et al., 2026, Shanghai AI Lab) — агент улучшает собственный операционный харнес внутренним циклом «Weakness Mining → Harness Proposal → Proposal Validation», принимая правки только после регрессионного теста.
- HarnessX / AEGIS (Darwin Agent Team, 2026) — «литейный цех» харнесов: типизированные примитивы с алгеброй подстановок эволюционируют внешним trace-driven движком.
Именно эти две работы образуют, соответственно, локальный и глобальный контуры предложенной архитектуры.
11.3. Автоматический дизайн и переписывание агента
- ADAS / Meta Agent Search (Hu, Lu, Clune, 2024) — внешний мета-агент программирует новых агентов в коде, итеративно изобретая строительные блоки.
- Gödel Agent (Yin et al., 2024) — самореферентный агент, рекурсивно изменяющий собственную логику.
- Darwin Gödel Machine (Zhang et al., 2025) — открытая эволюция: архив самомодифицирующихся кодовых агентов с эмпирической проверкой каждой правки на бенчмарках.
- EvoAgentX (Wang et al., 2025) — фреймворк автоматической эволюции мультиагентных воркфлоу.
Эти системы дают наибольшую свободу (меняют код и архитектуру), но требуют сильного контроля безопасности и слабо приспособлены к жёсткому регуляторному аудиту «из коробки».
| Система | Что эволюционирует | Локус цикла | Особенности / релевантность конвейеру |
|---|---|---|---|
| Reflexion (2023) | Поведение в рантайме (вербальная память) | Внутренний | Саморефлексия по обратной связи без обновления весов. |
| PromptBreeder (2023) | Промпты | Самореферентный | Эволюция промптов, мутирующих сами себя. |
| GEPA (2025) | Промпты системы | Внешний оптимизатор | Рефлексивная эволюция с Парето-отбором; экономичнее RL. |
| ADAS / Meta Agent (2024) | Код / архитектура агента | Внешний мета-агент | Мета-агент программирует новых агентов в коде. |
| Gödel Agent (2024) | Собственный код и логика | Внутренний (рекурсивно) | Самореферентное рекурсивное самоулучшение. |
| Darwin Gödel Machine (2025) | Код агента | Внутренний + архив | Открытая эволюция; эмпирическая валидация правок. |
| EvoAgentX (2025) | Агентные воркфлоу | Внешний фреймворк | Автоматическая эволюция мультиагентных воркфлоу. |
| Self-Harness (2026) | Харнес (промпт, инструменты, контроль) | Внутренний (сам агент) | Weakness Mining → Proposal → Validation; локальный контур. |
| HarnessX / AEGIS (2026) | Примитивы харнеса | Внешний движок | Алгебра подстановок, trace-driven; глобальный контур. |
| Двухконтурная 2.3 (предлагается) | Харнес — на обоих уровнях | Внутренний + внешний | Self-Harness (быстро) + AEGIS (стратегически) + обязательный аудиторский гейт под 115-ФЗ/152-ФЗ. |
На этой карте видно отличие предложенного решения. Системы оптимизации промптов аудируемы, но ограничены текстовым слоем; системы автоматического дизайна кода (ADAS, Gödel-семейство) максимально свободны, но трудно сертифицируемы. Self-Harness и HarnessX работают на «золотой середине» — уровне харнеса, — но порознь: один силён скоростью внутренней самокоррекции, другой — глубиной внешней стратегической эволюции. Двухконтурная архитектура объединяет оба контура и добавляет обязательный аудиторский гейт, которого академические системы, как правило, не предусматривают, — именно это делает её пригодной для эксплуатации под надзором регулятора.
12. Риски самоэволюции и ограничения
Риск «мисэволюции». Самообучающиеся агенты несут риск деградации качества или безопасности в ходе автономных изменений. Обзор Fang et al. (2025) формулирует три принципа: Endure — сохранение безопасности, Excel — недопущение деградации текущих способностей, Evolve — собственно улучшение. В предложенной архитектуре они операционализированы регрессионным ретро-тестом в песочнице и обязательным аудиторским гейтом: ни одно изменение не достигает продакшна без подтверждённого улучшения метрик и записи в журнал эволюции.
Помимо этого следует учитывать естественные ограничения подхода: качество эволюции наследует качество разметки трасс и «золотых наборов»; внутренний контур ограничен потолком текущей LLM, а внешний — стоимостью и задержкой более мощной аналитики; для надёжной оценки агентских метрик (например, устойчивости к сдвигу распределения) нужна объёмная историческая выборка. Эти ограничения определяют состав дорожной карты.
13. Дорожная карта и план развития
Первоочередные шаги внедрения:
- Формализовать примитивы: декомпозировать текущие харнесы на атомарные блоки.
- Развернуть ретро-среду: на исторических данных с теми же метрическими панелями.
- Внедрить журнал эволюции: с полным аудиторским следом и стоп-краны для высокорисковых операций.
За горизонтом двухконтурной архитектуры — пять стратегических направлений, переводящих систему из реактивной адаптации в проактивное управление рисками.
13.1. Проактивный комплаенс-мониторинг на основе предиктивных моделей
Современный конвейер реагирует на уже случившиеся отклонения метрик. Следующий шаг — предиктивный комплаенс: модели машинного обучения анализируют поток заявок, поведение контрагентов и слабые сигналы из внешних источников (изменения в реестрах, новостной фон, динамика законодательных инициатив) и предсказывают риск нарушения 115-ФЗ ещё до совершения операции. При достижении пороговой вероятности AEGIS может автоматически инициировать адаптацию харнеса — например, временно включить дополнительный уровень верификации бенефициаров для сегмента с повышенным прогнозным риском. Все решения сохраняются в журнале аудита.
13.2. Автоматическое дообучение агентов на ошибочных эпизодах (LoRA fine-tuning)
Сейчас оба контура адаптируют только харнес (промпты и цепочки вызовов), не трогая веса языковой модели. Наиболее устойчивое улучшение требует тонкой настройки самой LLM на критических ошибках, выявленных в проде. Low-Rank Adaptation (LoRA) — легковесный метод дообучения, не требующий перетренировки всей модели. Трассы с ошибками анонимизируются и формируют датасет; LoRA-адаптеры тренируются в sandbox-среде, проходят ретро-тестирование и при улучшении метрик деплоятся вместе с обновлённым харнесом. Журнал эволюции фиксирует, какие примеры послужили причиной дообучения, что удовлетворяет требованиям explainable AI.
13.3. Расширение контура 152-ФЗ: автоматическое маскирование персональных данных
По мере роста взаимодействий с клиентами через чат-интерфейсы возникает риск «утечки» ПДн в диалоговых логах. План включает автоматическое маскирование ПДн на лету непосредственно в Kafka-стриме трасс: специализированный NLP-модуль (например, fine-tuned NER-модель) обнаруживает ФИО, паспортные данные, адреса, ИНН и телефонные номера и заменяет их токенами-псевдонимами до попадания трассы в постоянное хранилище. Это полностью выполняет требования 152-ФЗ и позволяет легально использовать диалоговые данные для улучшения метрик и дообучения.
13.4. Мультимодальные метрики для изображений документов
Конвейер всё чаще работает со сканами паспортов, уставов, балансов. Для оценки агентов, обрабатывающих изображения, нужны мультимодальные метрики: точность распознавания ключевых зон (серия/номер паспорта, печати, подписи), устойчивость к поворотам и зашумлению, кросс-модальная согласованность (совпадает ли текст из скана с машиночитаемой зоной). Мультимодальный контур сможет адаптировать не только промпты, но и параметры предобработки изображений, основываясь на потоке визуальных трасс.
13.5. Федеративное обучение метрик качества
Банки редко могут централизовать данные для обучения метрик из-за регуляторных ограничений и коммерческой тайны. Федеративное обучение позволяет тренировать модель метрик (например, классификатор галлюцинаций) распределённо: она остаётся внутри контура каждого участника, а обновления агрегируются без передачи сырых данных. Это создаёт основу отраслевого консорциума по оценке качества кредитных агентов, не нарушая 152-ФЗ и банковскую тайну. Журнал эволюции содержит хеши агрегированных обновлений, обеспечивая прозрачность без раскрытия чувствительной информации.
Заключение
Итог. Кредитный конвейер 2.3 — это не замена людей, а ликвидация самой опасной рутины: бесконечного ручного латания промптов в ответ на подвижки регулирования. Объединяя внешний движок AEGIS и внутренний Self-Harness в двухконтурную архитектуру, система сама диагностирует свои слабости, предлагает точечную терапию на уровне харнеса и проводит каждое изменение через ретро-тест и аудиторский гейт. На фоне общего ландшафта самоэволюционирующих агентов решение отличает прицельный выбор уровня харнеса и встроенный комплаенс-контур, а человек выполняет роль стратегического контролёра.
Литература
- Ахтямов Р.Э. Кредитный конвейер 2.2: система метрик качества для LLM-агентов // Вестник финансовых технологий. 2026. Т. 2, вып. 2.
- Chen T., Lu S., Zhao K. et al. (Darwin Agent Team). HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry. 2026. arXiv:2606.14249.
- Zhang H., Zhang S., Li K. et al. Self-Harness: Harnesses That Improve Themselves. 2026. arXiv:2606.09498.
- Agrawal L.A., Tan S., Soylu D. et al. GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning. 2025. arXiv:2507.19457.
- Fernando C., Banarse D., Michalewski H. et al. PromptBreeder: Self-Referential Self-Improvement via Prompt Evolution. 2023. arXiv:2309.16797.
- Shinn N., Cassano F., Gopinath A. et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023. arXiv:2303.11366.
- Hu S., Lu C., Clune J. Automated Design of Agentic Systems. ICLR 2025. arXiv:2408.08435.
- Yin X., Wang X., Pan L. et al. Gödel Agent: A Self-Referential Framework for Recursive Self-Improvement. 2024. arXiv:2410.04444.
- Zhang J., Hu S., Lu C., Lange R., Clune J. Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents. 2025. arXiv:2505.22954.
- Wang Y., Liu S., Fang J., Meng Z. EvoAgentX: An Automated Framework for Evolving Agentic Workflows. 2025. arXiv:2507.03616.
- Fang J., Peng Y., Zhang X. et al. A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems. 2025. arXiv:2508.07407.
- A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence. 2025. arXiv:2507.21046.
- Федеральный закон от 07.08.2001 № 115-ФЗ «О противодействии легализации (отмыванию) доходов, полученных преступным путём, и финансированию терроризма».
- Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных».
Статьи цикла «Кредитный конвейер»







