Кредитный конвейер 2.2: система метрик качества для LLM-агентов

ВЕСТНИК ФИНАНСОВЫХ ТЕХНОЛОГИЙ · СПЕЦВЫПУСК «ИИ В БАНКОВСКОМ КОМПЛАЕНСЕ»
2026 · Том 2 · Выпуск 2
Равиль Ахтямов
Равиль Ахтямов, к.э.н. Digital Economy Lab · digitaleconomylab.ru

АННОТАЦИЯ

Переход от монолитных скоринговых моделей к мультиагентным LLM-системам в корпоративном кредитовании создаёт новые вызовы для контроля качества. Классические метрики машинного обучения (accuracy, precision, recall) фиксируют лишь финальный бинарный исход, но не отражают внутренние ошибки агентов: галлюцинации в юридически значимых полях, нарушение последовательности диалога, пропуск обязательных шагов комплаенс-контроля. В статье предлагается трёхуровневая система метрик качества, охватывающая диалоговые характеристики, успешность выполнения бизнес-задач и сквозные параметры агентов. Каждый из пятнадцати показателей формализован через правило вычисления, что обеспечивает воспроизводимость измерений. Методология базируется на архитектуре кредитного конвейера 2.1 (семислойная модель с горизонталью безопасности на анклавах TEE) и расширяет её измерительным слоем, обеспечивая аудируемость каждого действия агента в соответствии с требованиями 115-ФЗ и 152-ФЗ.

Ключевые слова: LLM-агенты, мультиагентные системы, кредитный конвейер, метрики качества, галлюцинации, комплаенс, LLM-as-a-judge, TEE, корпоративное кредитование, аудируемость ИИ.


Содержание

  1. Введение: проблема измеримости качества ИИ-агентов
  2. Методологическая рамка: трёхуровневая архитектура метрик
  3. Операционализация: 15 ключевых показателей
  4. Инструментарий и промышленный стек
  5. Иллюстративные сценарии: моделирование кредитных сделок
  6. Сравнение с мировыми практиками
  7. Ограничения и пути развития (конвейер 2.3)
  8. Заключение

1. Введение: проблема измеримости качества ИИ-агентов

Кредитный конвейер нового поколения — это не просто «скоринг плюс правила», а оркестр специализированных LLM-агентов, каждый из которых ведёт диалог, принимает решения и взаимодействует с внешними реестрами. Но как измерить качество оркестра, если каждая скрипка играет свою партию?

Классические метрики машинного обучения — accuracy, precision, recall, AUC-ROC — исторически сложились вокруг бинарного исхода: одобрить или отклонить заявку. В мире монолитного градиентного бустинга и логистической регрессии этого было достаточно. Однако мультиагентная архитектура, в которой Agent-Assistant ведёт диалог с клиентом, Agent-Underwriter анализирует финансовое состояние, Agent-Compliance проверяет санкционные списки, а Agent-Lawyer формирует договорную документацию, требует принципиально иного подхода к измерению качества.

Ключевая проблема. Финальная заявка может быть обработана корректно, но при этом агент-андеррайтер мог допустить галлюцинацию в дате регистрации компании, агент-юрист — пропустить проверку по 115-ФЗ, а агент-ассистент — нарушить речевой этикет. Эти ошибки накапливаются и проявляются только при регуляторной проверке или репутационном кризисе.

Настоящая статья предлагает трёхуровневую систему метрик качества, которая:

  • локализует источник ошибки на уровне диалога, задачи или агента;
  • обеспецивает сквозную аудируемость в соответствии с 115-ФЗ и 152-ФЗ;
  • позволяет строить дашборды как для оперативного мониторинга (P95 задержек, эскалации), так и для офлайн-аудита (галлюцинации, стабильность);
  • интегрируется с промышленным стеком (Kafka, LangFuse, Qdrant, Grafana) без изменения бизнес-логики.

Методология базируется на архитектуре кредитного конвейера 2.1 — семислойной модели с горизонталью безопасности на базе анклавов TEE — и расширяет её полноценным измерительным слоем.

2. Методологическая рамка: трёхуровневая архитектура метрик

В основе подхода лежит принцип разделения ответственности между тремя уровнями, что позволяет локализовать ошибку и оценить вклад каждого компонента в итоговое качество системы. Измерительный слой встраивается в существующую семислойную архитектуру конвейера как самостоятельный седьмой слой и не требует вмешательства в бизнес-логику агентов.

Семислойная архитектура кредитного конвейера 2.2

Рис. 1. Интеграция слоя метрик качества в семислойную архитектуру конвейера 2.2.
Рис. 1. Интеграция слоя метрик качества в семислойную архитектуру конвейера 2.2. Измерительный слой (слой 7) охватывает все уровни — от каналов до шины событий — по принципу «наблюдаемость без вторжения».
Слой Содержание
Слой 1 · Каналы взаимодействия Web-портал · мобильное приложение · чат-бот · API партнёров · внутренний портал андеррайтера
Слой 2 · Оркестрация BPMN LangGraph StateGraph · маршрутизация состояний · управление контекстом диалога
Слой 3 · Бизнес-сервисы Правила (Drools) · скоринг ML · БКИ / ФНС · LLM-агенты · граф связей · документооборот
Слой 4 · Agent-Bridge + TEE Incus/LXD · mTLS · изолированный инференс · контроль целостности промптов
Слой 5 · Данные PostgreSQL (транзакции) · Qdrant (векторный поиск) · Redis (кэш сессий) · S3 (документы)
Слой 6 · Шина событий Apache Kafka · API mTLS · аудит-лог всех событий · трейсинг LangFuse
Слой 7 · Метрики качества Диалоговые метрики · метрики задачи · агентские метрики (новый измерительный слой конвейера 2.2)
Табл. 1. Состав слоёв семислойной архитектуры и измерительный слой конвейера 2.2.

Три уровня ответственности

  • Уровень 1. Диалоговые метрики оценивают каждый отдельный ответ LLM-агента в процессе взаимодействия с клиентом или внутренним пользователем. Они характеризуют корректность, безопасность и соответствие речевому этикету конкретного высказывания.
  • Уровень 2. Метрики задачи — это бинарные или количественные показатели успешного завершения бизнес-операции: верификация ИНН, принятие кредитного решения, формирование договора. Они отвечают на вопрос «достигнута ли бизнес-цель?».
  • Уровень 3. Агентские метрики — сквозные характеристики конкретного агента (например, Agent-Assistant или Agent-Underwriter) на множестве диалогов: частота галлюцинаций, стабильность поведения, способность к восстановлению после сбоя.
Рис. 2. Взаимосвязи трёх уровней метрик.
Рис. 2. Взаимосвязи трёх уровней метрик. Ошибка на уровне диалога может привести к провалу бизнес-задачи и отразиться на сквозном агентском показателе; механизм эскалации ошибок направлен снизу вверх.

Такая трёхуровневая декомпозиция согласуется с принципом покомпонентной (композиционной) оценки мультиагентных систем и опирается на методологию «LLM-as-a-judge», систематически исследованную в работе Zheng et al. (2023). Она позволяет строить дашборды как для оперативного мониторинга, так и для офлайн-аудита.

3. Операционализация: 15 ключевых показателей

Каждый уровень включает пять конкретных метрик, определённых через формальные правила вычисления. Ниже для каждой группы приведены краткие определения, метод вычисления и расчётные формулы, обеспечивающие научную воспроизводимость.

Уровень 1. Диалоговые метрики

Метрика Определение Метод вычисления
Релевантность ответа Семантическое сходство между ответом агента и эталонным ответом из «золотого набора» Косинусное сходство ≥ 0,8 на эмбеддингах RuBERT
Токсичность и безопасность Доля ответов, содержащих агрессию, дискриминацию или нецензурную лексику Классификатор на основе RuBERT
Compliance-likelihood Вероятность нарушения комплаенс-правил (например, обещание гарантированного одобрения) Специализированный LLM-классификатор
Полнота контекста Отношение извлечённых фактов из предыдущих сообщений к общему числу релевантных LLM-as-a-judge
Задержка ответа (P95) Время генерации ответа, мс (95-й перцентиль) Prometheus-метрика на уровне инференса

Расчётные формулы:

Relevance(a, a*) = cos( enc(a), enc(a*) ), порог ≥ 0,8; enc — кодировщик RuBERT
ToxicityRate = N_токс / N_всего
ContextCompleteness = | факты_извлечённые ∩ факты_релевантные | / | факты_релевантные |
Latency_P95 = perc_95( t_генерации )

где a — ответ агента, a* — эталонный ответ из «золотого набора»; флаг комплаенс-нарушения выставляется при p_наруш ≥ θ, где θ — настраиваемый порог классификатора.

Уровень 2. Метрики задачи

Метрика Определение Источник данных
Success Rate Доля заявок, прошедших полный цикл без ручного вмешательства Статусы в Kafka-логах
Точность верификации ИНН Процент совпадений извлечённого ИНН с данными ФНС mTLS-запрос к ФНС
Ложные срабатывания комплаенс Частота ошибочной блокировки заявки как подозрительной Сравнение с решением эксперта
Время выполнения (медиана) От создания заявки до финального статуса Timestamp-ы в Kafka
Коэффициент эскалации Доля заявок, переданных на ручную проверку Флаг human_review в BPMN

Расчётные формулы:

SuccessRate = N_авто-завершённых / N_всего
INN_Accuracy = N_совпадений / N_проверенных
FalsePositiveRate = FP / (FP + TN)
MedianTime = median( t_финал − t_создание )
EscalationCoef = N_human_review / N_всего

Уровень 3. Агентские метрики

Метрика Определение Метод вычисления
Hallucination Rate Доля ответов с фактически неверной информацией Проверка по ФНС и справочным БД
Consistency Score Стабильность ответов на идентичные запросы Вариативность по 5 запускам
Instruction Adherence Процент выполнения явных инструкций Правила в LangGraph
Recovery Rate Способность исправить ошибку после уточняющего вопроса Доля успешных recovery-эпизодов
Adaptability Index Изменение Success Rate при сдвиге распределения входных данных Офлайн-тест на исторических срезах

Расчётные формулы:

HallucinationRate = N_галлюцинаций / N_всего_ответов
ConsistencyScore = 1 − ⟨ d_сем( y_i, y_j ) ⟩ по k = 5 повторам
InstructionAdherence = N_выполненных_инструкций / N_всего_инструкций
RecoveryRate = N_успешных_recovery / N_recovery-эпизодов
AdaptabilityIndex = SuccessRate(сдвиг) / SuccessRate(база)
Рис. 3. Радарные профили качества трёх типовых агентов
Рис. 3. Радарные профили качества трёх типовых агентов (значения нормализованы: 1 — наилучшее, иллюстративно). Оси приведены к положительной ориентации: «Безопасность» = 1 − токсичность, «Достоверность» = 1 − Hallucination Rate, «Контроль ложн. срабат.» = 1 − доля ложных срабатываний. Agent-Assistant силён в диалоговых метриках, Agent-Underwriter — в задачных, Agent-Compliance — в сквозных.

4. Инструментарий и промышленный стек

Реализация системы метрик опирается на открытые компоненты, обеспечивающие аудит и масштабирование. Архитектура построена по принципу «наблюдаемость без вторжения»: сбор метрик не требует изменения бизнес-логики агентов. Центральным элементом служит шина Kafka, которая агрегирует события от всех компонентов и передаёт их в LangFuse для трейсинга и в Grafana для мониторинга.

Рис. 4. Промышленный стек реализации метрик.
Рис. 4. Промышленный стек реализации метрик. Сбор данных организован вокруг шины событий Kafka, что обеспечивает единый аудит-лог и трейсинг без модификации агентов.
Функция Назначение Компоненты
Оркестрация Управление состояниями агентов и маршрутизация диалогов LangGraph · Agent-Bridge · Incus/LXD
Трейсинг Синхронизация с Kafka, хранение всех шагов агента LangFuse · OpenTelemetry
LLM-инференс Продуктивные модели и прототипирование vLLM · Ollama · Llama-3 · Qwen-2.5
LLM-as-a-judge Оценка релевантности и комплаенс-вероятности GigaChat API · Llama 3.1 70B
Векторный поиск Контекстный поиск похожих диалогов Qdrant · RuBERT embeddings
Мониторинг P95 задержек, число эскалаций, алерты Grafana · Prometheus · AlertManager
Безопасность Изолированный инференс и контроль целостности промптов TEE / Incus · mTLS
Табл. 2. Компоненты промышленного стека реализации системы метрик.

5. Иллюстративные сценарии: моделирование кредитных сделок

Для демонстрации работы метрик рассмотрим три типовые заявки (наименования заёмщиков изменены). Каждая заявка прогоняется через полный конвейер с включённым сбором метрик. Приведённые значения являются иллюстративными и показывают диагностическую ценность системы, а не результаты промышленного замера.

Показатель Сценарий 1 — стандартное одобрение Сценарий 2 — галлюцинация андеррайтера Сценарий 3 — санкционные связи
Профиль заёмщика Производственное предприятие, чистая кредитная история Инвесткомпания; агент указал неверную дату регистрации Финансовая группа; выявлены косвенные связи с санкционным лицом
Success Rate 100 % 0 %
Hallucination Rate 0 0,4
Compliance-likelihood 0,98 0,35
Полнота контекста 0,92
Instruction Adherence 0,7
Recovery Rate 1,0
Эскалация нет 0,33
Итог ✓ Пройдено ⚠ Эскалация и восстановление ✕ Комплаенс-стоп (отказ)

Диагностическая ценность. Сценарии подтверждают, что трёхуровневая система метрик позволяет диагностировать как технические ошибки (галлюцинации), так и содержательные комплаенс-риски. Эскалация срабатывает штатно, Recovery Rate даёт возможность завершить сделку после вмешательства человека. Автоматический отказ по комплаенсу в Сценарии 3 — это корректное поведение системы, а не сбой.

6. Сравнение с мировыми практиками

Предложенная система метрик соотносится с подходами, применяемыми в международных финтех-лабораториях. Для сопоставления используются два обобщённых класса архитектур (не конкретные продукты): класс A — диалогово-ориентированные системы, в которых акцент сделан на качестве диалоговых агентов; класс B — оркестраторные мультиагентные системы, в которых ведущую роль играет координация задач между агентами.

Характеристика Класс A (диалоговые системы) Класс B (оркестраторные системы) Кредитный конвейер 2.2
Уровни метрик 2 (диалог + задача) 2 (агент + задача) 3 (диалог + задача + агент)
Юридический контур Не реализован Частичный (KYC) Полный (115-ФЗ, 152-ФЗ)
LLM-as-a-judge Англоязычный LLM Англоязычный LLM GigaChat + Llama 3.1 (рус.)
Калибровка на нормах РФ Нет Нет Да (нормативные документы Банка России)
Офлайн/онлайн-режимы Онлайн Онлайн Оба режима
TEE-анклавы Нет Опционально Обязательно (Incus/LXD)

Отличительной особенностью предлагаемой реализации является интеграция юридического контура на уровне агента-юриста, а также использование LLM-as-a-judge на русском языке с калибровкой на нормативных документах Банка России. Дополнительным преимуществом выступает поддержка офлайн- и онлайн-режимов сбора метрик, что позволяет тестировать новые версии агентов до выкатки в продуктив.

7. Ограничения и пути развития (конвейер 2.3)

Предлагаемая система имеет ряд ограничений, которые определяют направления дальнейших исследований:

  • LLM-as-a-judge может ошибаться в сложных юридических казусах (например, при оценке бенефициарных связей или косвенного контроля);
  • чувствительность к качеству разметки — метрики, основанные на сравнении с «золотым набором», наследуют ошибки аннотаторов;
  • требование к объёму выборки — для агентских метрик (в частности, Adaptability Index) необходима объёмная историческая выборка (не менее нескольких тысяч диалогов);
  • вычислительная стоимость — сквозной LLM-as-a-judge аудит увеличивает затраты на инференс в 2–3 раза.

План развития: конвейер 2.3

  • Проактивный комплаенс-мониторинг на основе предиктивных моделей, выявляющих риски до совершения операции.
  • Автоматическое дообучение агентов на ошибочных эпизодах (fine-tuning с использованием LoRA) — непрерывное улучшение качества без полной перетренировки.
  • Расширение контура персональных данных проверкой по 152-ФЗ в диалоговых логах, включая автоматическое маскирование ПДн.
  • Мультимодальные метрики для агентов, работающих с документами в формате изображений (паспорта, учредительные документы).
  • Федеративное обучение метрик качества на распределённых данных без их централизации.

8. Заключение

Разработанная трёхуровневая система метрик качества для LLM-агентов кредитного конвейера 2.2 закрывает критический пробел между «чёрным ящиком» мультиагентных систем и требованиями регуляторов к аудируемости. Предложенная методология позволяет:

  • объективно оценивать корректность работы ИИ-агентов в реальном времени на трёх уровнях гранулярности;
  • снизить долю ручных проверок при сохранении контроля юридических рисков за счёт автоматической эскалации только проблемных случаев;
  • обеспечить аудируемость каждого действия агента в соответствии с требованиями 115-ФЗ и 152-ФЗ;
  • создать основу для непрерывного улучшения агентов через адаптивное дообучение на ошибочных эпизодах.

Методология прошла концептуальную валидацию на типовых сценариях и может быть внедрена в промышленную эксплуатацию в кредитных организациях, использующих LLM-агентов. Дальнейшие исследования будут направлены на повышение точности юридического классификатора, расширение набора диагностических метрик и валидацию подхода на реальных производственных данных.

Литература

  1. Федеральный закон от 07.08.2001 № 115-ФЗ «О противодействии легализации (отмыванию) доходов, полученных преступным путём, и финансированию терроризма».
  2. Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных».
  3. Zheng L., Chiang W.-L., Sheng Y. et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena // Advances in Neural Information Processing Systems 36 (NeurIPS 2023), Datasets and Benchmarks Track. 2023. arXiv:2306.05685.
  4. Kuratov Y., Arkhipov M. Adaptation of Deep Bidirectional Multilingual Transformers for Russian Language. 2019. arXiv:1905.07213. (модель RuBERT, проект DeepPavlov).
  5. LangChain. LangGraph: Stateful, Multi-Actor Applications with LLMs. Документация. 2025. URL: langchain-ai.github.io/langgraph.
  6. Langfuse. Open-Source LLM Engineering Platform. Документация. 2025. URL: langfuse.com.

Статьи цикла «Кредитный конвейер»