
Метрика в AI-контракте: baseline, acceptance и rollback
Метрика в AI-контракте работает только вместе с baseline, точным способом расчёта, источником данных и процедурой приёмки. Документ должен различать качество модели и бизнес-результат, назначать владельца, описывать исключения, monitoring и последствия изменения версии. Если результат нельзя воспроизвести или безопасно откатить, формальная цифра не защищает заказчика и исполнителя.
Краткие выводы
- —Baseline и выборка становятся приложением к приёмке.
- —Формула метрики определяет включения, исключения и округление.
- —Модельный показатель не подменяет бизнес-результат.
- —Изменение модели запускает согласованный retest.
- —Rollback и владение данными фиксируются до запуска.
Baseline фиксирует исходную систему
Опишите текущий процесс, период, объём, типы задач, человеческие решения, ошибки и стоимость. Сохраните исходную выборку и правила разметки. Без baseline невозможно отделить эффект решения от сезонности, новой команды или изменения входящего потока. Услуга task control помогает превратить критерий результата в наблюдаемые статусы и владельца.
Определение метрики исключает двусмысленность
Укажите единицу наблюдения, формулу, источник, окно измерения, допустимые исключения, обработку пропусков и округление. Отдельно опишите, что считается ошибкой и кто разрешает спор. Если метрика использует человеческую оценку, приложите rubric, примеры и процедуру расхождения рецензентов. Руководство по внедрению ИИ связывает метрику с владельцем процесса.
Чек-лист приложения к договору
- Цель процесса и недопустимый исход.
- Baseline, версия данных и правила выборки.
- Формула, источник и владелец метрики.
- Acceptance set и независимая процедура проверки.
- SLO, monitoring, отчётность и incident response.
- Права на данные, логи, модели и производные материалы.
- Change control, retest, rollback и прекращение доступа.
Acceptance отделяет модель от бизнес-результата
Сначала проверяется техническое качество на согласованной выборке, затем ограниченный процессный результат при заданных условиях. Бизнес-эффект нельзя гарантировать одной модельной метрикой, потому что он зависит от внедрения и поведения пользователей. NIST AI RMF помогает формализовать измерение и управление риском на протяжении жизненного цикла.[1]
Изменение модели требует retest
Версия модели, prompt, knowledge base, tools и policy влияет на результат. Договор определяет, какие изменения существенны, кто их согласует и какая часть acceptance повторяется. Публичный legal-agent кейс показывает предметный юридический контур, но не заменяет адаптацию условий к юрисдикции и конкретной закупке.
Ограничения и failure modes
Опасны метрика без доступа к данным, приёмка на обучающей выборке, односторонняя смена модели и обязательство по результату, которым поставщик не управляет. Также контракт не заменяет технический контроль. Rollback, выгрузка данных и прекращение ключей должны быть проверяемыми действиями, а не общей фразой.[1]
Частые вопросы
С чего начинать внедрение?
С узкой задачи, baseline, владельца процесса и безопасного ручного fallback. Архитектура выбирается только после описания данных, действий и цены ошибки.
Какая метрика считается достаточной?
Та, которая связана с принятым полезным результатом, имеет источник данных, формулу, владельца и правила обработки исключений.
Когда автоматизацию нужно остановить?
При неизвестном состоянии, неподтверждённом действии, нарушении доступа, ухудшении качества или отсутствии безопасного rollback.
Источники и основания
- 1.AI Risk Management Framework — Управление рисками и ответственностью AI-систем.
- 2.Guidelines for AI procurement — Контекст закупки, прозрачности и ответственности AI.
- 3.OECD AI Principles — Принципы устойчивости, прозрачности и ответственности AI.
- 4.Secure Software Development Framework — Change control и безопасный жизненный цикл.