2026 · Том 2 · Выпуск 2
АННОТАЦИЯ
Переход от монолитных скоринговых моделей к мультиагентным LLM-системам в корпоративном кредитовании создаёт новые вызовы для контроля качества. Классические метрики машинного обучения (accuracy, precision, recall) фиксируют лишь финальный бинарный исход, но не отражают внутренние ошибки агентов: галлюцинации в юридически значимых полях, нарушение последовательности диалога, пропуск обязательных шагов комплаенс-контроля. В статье предлагается трёхуровневая система метрик качества, охватывающая диалоговые характеристики, успешность выполнения бизнес-задач и сквозные параметры агентов. Каждый из пятнадцати показателей формализован через правило вычисления, что обеспечивает воспроизводимость измерений. Методология базируется на архитектуре кредитного конвейера 2.1 (семислойная модель с горизонталью безопасности на анклавах TEE) и расширяет её измерительным слоем, обеспечивая аудируемость каждого действия агента в соответствии с требованиями 115-ФЗ и 152-ФЗ.
Ключевые слова: LLM-агенты, мультиагентные системы, кредитный конвейер, метрики качества, галлюцинации, комплаенс, LLM-as-a-judge, TEE, корпоративное кредитование, аудируемость ИИ.
Содержание
- Введение: проблема измеримости качества ИИ-агентов
- Методологическая рамка: трёхуровневая архитектура метрик
- Операционализация: 15 ключевых показателей
- Инструментарий и промышленный стек
- Иллюстративные сценарии: моделирование кредитных сделок
- Сравнение с мировыми практиками
- Ограничения и пути развития (конвейер 2.3)
- Заключение
1. Введение: проблема измеримости качества ИИ-агентов
Кредитный конвейер нового поколения — это не просто «скоринг плюс правила», а оркестр специализированных LLM-агентов, каждый из которых ведёт диалог, принимает решения и взаимодействует с внешними реестрами. Но как измерить качество оркестра, если каждая скрипка играет свою партию?
Классические метрики машинного обучения — accuracy, precision, recall, AUC-ROC — исторически сложились вокруг бинарного исхода: одобрить или отклонить заявку. В мире монолитного градиентного бустинга и логистической регрессии этого было достаточно. Однако мультиагентная архитектура, в которой Agent-Assistant ведёт диалог с клиентом, Agent-Underwriter анализирует финансовое состояние, Agent-Compliance проверяет санкционные списки, а Agent-Lawyer формирует договорную документацию, требует принципиально иного подхода к измерению качества.
Ключевая проблема. Финальная заявка может быть обработана корректно, но при этом агент-андеррайтер мог допустить галлюцинацию в дате регистрации компании, агент-юрист — пропустить проверку по 115-ФЗ, а агент-ассистент — нарушить речевой этикет. Эти ошибки накапливаются и проявляются только при регуляторной проверке или репутационном кризисе.
Настоящая статья предлагает трёхуровневую систему метрик качества, которая:
- локализует источник ошибки на уровне диалога, задачи или агента;
- обеспецивает сквозную аудируемость в соответствии с 115-ФЗ и 152-ФЗ;
- позволяет строить дашборды как для оперативного мониторинга (P95 задержек, эскалации), так и для офлайн-аудита (галлюцинации, стабильность);
- интегрируется с промышленным стеком (Kafka, LangFuse, Qdrant, Grafana) без изменения бизнес-логики.
Методология базируется на архитектуре кредитного конвейера 2.1 — семислойной модели с горизонталью безопасности на базе анклавов TEE — и расширяет её полноценным измерительным слоем.
2. Методологическая рамка: трёхуровневая архитектура метрик
В основе подхода лежит принцип разделения ответственности между тремя уровнями, что позволяет локализовать ошибку и оценить вклад каждого компонента в итоговое качество системы. Измерительный слой встраивается в существующую семислойную архитектуру конвейера как самостоятельный седьмой слой и не требует вмешательства в бизнес-логику агентов.
Семислойная архитектура кредитного конвейера 2.2
| Слой | Содержание |
|---|---|
| Слой 1 · Каналы взаимодействия | Web-портал · мобильное приложение · чат-бот · API партнёров · внутренний портал андеррайтера |
| Слой 2 · Оркестрация BPMN | LangGraph StateGraph · маршрутизация состояний · управление контекстом диалога |
| Слой 3 · Бизнес-сервисы | Правила (Drools) · скоринг ML · БКИ / ФНС · LLM-агенты · граф связей · документооборот |
| Слой 4 · Agent-Bridge + TEE | Incus/LXD · mTLS · изолированный инференс · контроль целостности промптов |
| Слой 5 · Данные | PostgreSQL (транзакции) · Qdrant (векторный поиск) · Redis (кэш сессий) · S3 (документы) |
| Слой 6 · Шина событий | Apache Kafka · API mTLS · аудит-лог всех событий · трейсинг LangFuse |
| Слой 7 · Метрики качества | Диалоговые метрики · метрики задачи · агентские метрики (новый измерительный слой конвейера 2.2) |
Три уровня ответственности
- Уровень 1. Диалоговые метрики оценивают каждый отдельный ответ LLM-агента в процессе взаимодействия с клиентом или внутренним пользователем. Они характеризуют корректность, безопасность и соответствие речевому этикету конкретного высказывания.
- Уровень 2. Метрики задачи — это бинарные или количественные показатели успешного завершения бизнес-операции: верификация ИНН, принятие кредитного решения, формирование договора. Они отвечают на вопрос «достигнута ли бизнес-цель?».
- Уровень 3. Агентские метрики — сквозные характеристики конкретного агента (например, Agent-Assistant или Agent-Underwriter) на множестве диалогов: частота галлюцинаций, стабильность поведения, способность к восстановлению после сбоя.
Такая трёхуровневая декомпозиция согласуется с принципом покомпонентной (композиционной) оценки мультиагентных систем и опирается на методологию «LLM-as-a-judge», систематически исследованную в работе Zheng et al. (2023). Она позволяет строить дашборды как для оперативного мониторинга, так и для офлайн-аудита.
3. Операционализация: 15 ключевых показателей
Каждый уровень включает пять конкретных метрик, определённых через формальные правила вычисления. Ниже для каждой группы приведены краткие определения, метод вычисления и расчётные формулы, обеспечивающие научную воспроизводимость.
Уровень 1. Диалоговые метрики
| Метрика | Определение | Метод вычисления |
|---|---|---|
| Релевантность ответа | Семантическое сходство между ответом агента и эталонным ответом из «золотого набора» | Косинусное сходство ≥ 0,8 на эмбеддингах RuBERT |
| Токсичность и безопасность | Доля ответов, содержащих агрессию, дискриминацию или нецензурную лексику | Классификатор на основе RuBERT |
| Compliance-likelihood | Вероятность нарушения комплаенс-правил (например, обещание гарантированного одобрения) | Специализированный LLM-классификатор |
| Полнота контекста | Отношение извлечённых фактов из предыдущих сообщений к общему числу релевантных | LLM-as-a-judge |
| Задержка ответа (P95) | Время генерации ответа, мс (95-й перцентиль) | Prometheus-метрика на уровне инференса |
Расчётные формулы:
ToxicityRate = N_токс / N_всего
ContextCompleteness = | факты_извлечённые ∩ факты_релевантные | / | факты_релевантные |
Latency_P95 = perc_95( t_генерации )
где a — ответ агента, a* — эталонный ответ из «золотого набора»; флаг комплаенс-нарушения выставляется при p_наруш ≥ θ, где θ — настраиваемый порог классификатора.
Уровень 2. Метрики задачи
| Метрика | Определение | Источник данных |
|---|---|---|
| Success Rate | Доля заявок, прошедших полный цикл без ручного вмешательства | Статусы в Kafka-логах |
| Точность верификации ИНН | Процент совпадений извлечённого ИНН с данными ФНС | mTLS-запрос к ФНС |
| Ложные срабатывания комплаенс | Частота ошибочной блокировки заявки как подозрительной | Сравнение с решением эксперта |
| Время выполнения (медиана) | От создания заявки до финального статуса | Timestamp-ы в Kafka |
| Коэффициент эскалации | Доля заявок, переданных на ручную проверку | Флаг human_review в BPMN |
Расчётные формулы:
INN_Accuracy = N_совпадений / N_проверенных
FalsePositiveRate = FP / (FP + TN)
MedianTime = median( t_финал − t_создание )
EscalationCoef = N_human_review / N_всего
Уровень 3. Агентские метрики
| Метрика | Определение | Метод вычисления |
|---|---|---|
| Hallucination Rate | Доля ответов с фактически неверной информацией | Проверка по ФНС и справочным БД |
| Consistency Score | Стабильность ответов на идентичные запросы | Вариативность по 5 запускам |
| Instruction Adherence | Процент выполнения явных инструкций | Правила в LangGraph |
| Recovery Rate | Способность исправить ошибку после уточняющего вопроса | Доля успешных recovery-эпизодов |
| Adaptability Index | Изменение Success Rate при сдвиге распределения входных данных | Офлайн-тест на исторических срезах |
Расчётные формулы:
ConsistencyScore = 1 − ⟨ d_сем( y_i, y_j ) ⟩ по k = 5 повторам
InstructionAdherence = N_выполненных_инструкций / N_всего_инструкций
RecoveryRate = N_успешных_recovery / N_recovery-эпизодов
AdaptabilityIndex = SuccessRate(сдвиг) / SuccessRate(база)
4. Инструментарий и промышленный стек
Реализация системы метрик опирается на открытые компоненты, обеспечивающие аудит и масштабирование. Архитектура построена по принципу «наблюдаемость без вторжения»: сбор метрик не требует изменения бизнес-логики агентов. Центральным элементом служит шина Kafka, которая агрегирует события от всех компонентов и передаёт их в LangFuse для трейсинга и в Grafana для мониторинга.
| Функция | Назначение | Компоненты |
|---|---|---|
| Оркестрация | Управление состояниями агентов и маршрутизация диалогов | LangGraph · Agent-Bridge · Incus/LXD |
| Трейсинг | Синхронизация с Kafka, хранение всех шагов агента | LangFuse · OpenTelemetry |
| LLM-инференс | Продуктивные модели и прототипирование | vLLM · Ollama · Llama-3 · Qwen-2.5 |
| LLM-as-a-judge | Оценка релевантности и комплаенс-вероятности | GigaChat API · Llama 3.1 70B |
| Векторный поиск | Контекстный поиск похожих диалогов | Qdrant · RuBERT embeddings |
| Мониторинг | P95 задержек, число эскалаций, алерты | Grafana · Prometheus · AlertManager |
| Безопасность | Изолированный инференс и контроль целостности промптов | TEE / Incus · mTLS |
5. Иллюстративные сценарии: моделирование кредитных сделок
Для демонстрации работы метрик рассмотрим три типовые заявки (наименования заёмщиков изменены). Каждая заявка прогоняется через полный конвейер с включённым сбором метрик. Приведённые значения являются иллюстративными и показывают диагностическую ценность системы, а не результаты промышленного замера.
| Показатель | Сценарий 1 — стандартное одобрение | Сценарий 2 — галлюцинация андеррайтера | Сценарий 3 — санкционные связи |
|---|---|---|---|
| Профиль заёмщика | Производственное предприятие, чистая кредитная история | Инвесткомпания; агент указал неверную дату регистрации | Финансовая группа; выявлены косвенные связи с санкционным лицом |
| Success Rate | 100 % | — | 0 % |
| Hallucination Rate | 0 | 0,4 | — |
| Compliance-likelihood | 0,98 | — | 0,35 |
| Полнота контекста | — | — | 0,92 |
| Instruction Adherence | — | 0,7 | — |
| Recovery Rate | — | 1,0 | — |
| Эскалация | нет | 0,33 | — |
| Итог | ✓ Пройдено | ⚠ Эскалация и восстановление | ✕ Комплаенс-стоп (отказ) |
Диагностическая ценность. Сценарии подтверждают, что трёхуровневая система метрик позволяет диагностировать как технические ошибки (галлюцинации), так и содержательные комплаенс-риски. Эскалация срабатывает штатно, Recovery Rate даёт возможность завершить сделку после вмешательства человека. Автоматический отказ по комплаенсу в Сценарии 3 — это корректное поведение системы, а не сбой.
6. Сравнение с мировыми практиками
Предложенная система метрик соотносится с подходами, применяемыми в международных финтех-лабораториях. Для сопоставления используются два обобщённых класса архитектур (не конкретные продукты): класс A — диалогово-ориентированные системы, в которых акцент сделан на качестве диалоговых агентов; класс B — оркестраторные мультиагентные системы, в которых ведущую роль играет координация задач между агентами.
| Характеристика | Класс A (диалоговые системы) | Класс B (оркестраторные системы) | Кредитный конвейер 2.2 |
|---|---|---|---|
| Уровни метрик | 2 (диалог + задача) | 2 (агент + задача) | 3 (диалог + задача + агент) |
| Юридический контур | Не реализован | Частичный (KYC) | Полный (115-ФЗ, 152-ФЗ) |
| LLM-as-a-judge | Англоязычный LLM | Англоязычный LLM | GigaChat + Llama 3.1 (рус.) |
| Калибровка на нормах РФ | Нет | Нет | Да (нормативные документы Банка России) |
| Офлайн/онлайн-режимы | Онлайн | Онлайн | Оба режима |
| TEE-анклавы | Нет | Опционально | Обязательно (Incus/LXD) |
Отличительной особенностью предлагаемой реализации является интеграция юридического контура на уровне агента-юриста, а также использование LLM-as-a-judge на русском языке с калибровкой на нормативных документах Банка России. Дополнительным преимуществом выступает поддержка офлайн- и онлайн-режимов сбора метрик, что позволяет тестировать новые версии агентов до выкатки в продуктив.
7. Ограничения и пути развития (конвейер 2.3)
Предлагаемая система имеет ряд ограничений, которые определяют направления дальнейших исследований:
- LLM-as-a-judge может ошибаться в сложных юридических казусах (например, при оценке бенефициарных связей или косвенного контроля);
- чувствительность к качеству разметки — метрики, основанные на сравнении с «золотым набором», наследуют ошибки аннотаторов;
- требование к объёму выборки — для агентских метрик (в частности, Adaptability Index) необходима объёмная историческая выборка (не менее нескольких тысяч диалогов);
- вычислительная стоимость — сквозной LLM-as-a-judge аудит увеличивает затраты на инференс в 2–3 раза.
План развития: конвейер 2.3
- Проактивный комплаенс-мониторинг на основе предиктивных моделей, выявляющих риски до совершения операции.
- Автоматическое дообучение агентов на ошибочных эпизодах (fine-tuning с использованием LoRA) — непрерывное улучшение качества без полной перетренировки.
- Расширение контура персональных данных проверкой по 152-ФЗ в диалоговых логах, включая автоматическое маскирование ПДн.
- Мультимодальные метрики для агентов, работающих с документами в формате изображений (паспорта, учредительные документы).
- Федеративное обучение метрик качества на распределённых данных без их централизации.
8. Заключение
Разработанная трёхуровневая система метрик качества для LLM-агентов кредитного конвейера 2.2 закрывает критический пробел между «чёрным ящиком» мультиагентных систем и требованиями регуляторов к аудируемости. Предложенная методология позволяет:
- объективно оценивать корректность работы ИИ-агентов в реальном времени на трёх уровнях гранулярности;
- снизить долю ручных проверок при сохранении контроля юридических рисков за счёт автоматической эскалации только проблемных случаев;
- обеспечить аудируемость каждого действия агента в соответствии с требованиями 115-ФЗ и 152-ФЗ;
- создать основу для непрерывного улучшения агентов через адаптивное дообучение на ошибочных эпизодах.
Методология прошла концептуальную валидацию на типовых сценариях и может быть внедрена в промышленную эксплуатацию в кредитных организациях, использующих LLM-агентов. Дальнейшие исследования будут направлены на повышение точности юридического классификатора, расширение набора диагностических метрик и валидацию подхода на реальных производственных данных.
Литература
- Федеральный закон от 07.08.2001 № 115-ФЗ «О противодействии легализации (отмыванию) доходов, полученных преступным путём, и финансированию терроризма».
- Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных».
- Zheng L., Chiang W.-L., Sheng Y. et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena // Advances in Neural Information Processing Systems 36 (NeurIPS 2023), Datasets and Benchmarks Track. 2023. arXiv:2306.05685.
- Kuratov Y., Arkhipov M. Adaptation of Deep Bidirectional Multilingual Transformers for Russian Language. 2019. arXiv:1905.07213. (модель RuBERT, проект DeepPavlov).
- LangChain. LangGraph: Stateful, Multi-Actor Applications with LLMs. Документация. 2025. URL: langchain-ai.github.io/langgraph.
- Langfuse. Open-Source LLM Engineering Platform. Документация. 2025. URL: langfuse.com.
Статьи цикла «Кредитный конвейер»
- Кредитный конвейер 2.0: архитектура, ИИ-агенты, BPM-оркестрация.
- Кредитный конвейер 2.1: безопасность ИИ-агентов — анклавы TEE, контроль целостности промптов.







