Legal AI Benchmarking: как это делают там. Часть 2: вендоры и...
Вторая часть большого обзора о том, как на западном рынке оценивают AI-продукты на юридических задачах.
В первой части речь шла о независимых фасилитаторах — тех, кто пытается проводить объективные замеры в интересах сообщества.
Сегодня в номере: что нам известно о том, как западные провайдеры юридических ИИ-сервисов измеряют собственное качество. Я обещала ещё и об академическом взгляде на бенчмаркинг, но почти ничего не будет — а почему так, узнаете ближе к концу!
Вендоры: кто меряет себя сам
Harvey и Legal Agent Benchmark
LAB — это опенсорсный агентный бенчмарк от самого известного провайдера юридического ИИ-сервиса, анонсированный 6 мая 2026. Список партнёров не просто внушительный, а совершенно недостижимый — там и Anthropic, и NVIDIA, и Google DeepMind… Первые результаты опубликовали 26 мая.
Harvey начинает с диагноза существующих бенчмарков, называя поимённо, включая свой собственный: LegalBench, CUAD, LEXam и собственный более ранний BigLaw Bench. Все они измеряют короткое рассуждение — прочитать договор, ответить на вопрос, сравнить дела, разобрать аргумент. LAB задуман мерить другое: не ответ на вопрос, а единицу работы, которую в фирме реально делегируют ассоциату — client matter.
Исходя из идеологии client matter-centric benchmark, каждое задание собрано из четырёх элементов, воспроизводящих поручение партнёра ассоциату:
- Инструкция — написана как запрос партнёра. Короткая (в среднем около 50 слов) и сформулирована через «что нужно», а не «как это сделать»
- Среда (Environment) — клиентское дело: набор документов в песочнице. Существенно, что туда намеренно кладут и релевантные файлы, и посторонние, которые агент должен научиться игнорировать
- Результат (Output) — не просто ответ на вопрос, а поддающийся проверке (reviewable) рабочий продукт юриста: меморандум, disclosure schedule, саммари позиции
- Верификация — экспертная рубрика, разбивающая продукт на атомарные критерии pass/fail, покрывающие факты, выводы, цитирования, структурные требования и аналитические ходы, которые обязан содержать проходной ответ
Масштаб:
- 1 251 задача
- 24 области юридической практики, т.е. не совсем отрасли права, а то, как обычно называются практики в юридических фирмах: от Data Privacy and Cybersecurity до International Trade and Sanctions
- больше 76 000 бинарных критериев
Медиана — 7 исходных документов и 57 критериев на задачу.
Пример задачи, который разбирает LawSites: поглощение Crestview Software Solutions за $458 млн полностью акциями. Агент должен проработать виртуальную комнату данных — восемь материальных договоров плюс сопутствующие документы, и найти положения о смене контроля по всему массиву, оценить риск сделки, предложить дальнейшие шаги и подготовить проект меморандума для команды сделки и совета директоров. Рубрика этой одной задачи — 57 критериев, покрывающих девять правовых проблем, разложенных по материалам.
Оценка — all-pass: если не читали первую часть цикла, то это означает, что задача засчитана, только если пройден каждый критерий, частичного зачёта нет. Harvey обосновывает all-pass критерий таким образом, что меморандум по сделке, поймавший восемь материальных рисков из десяти, полезен не на 80%. Один пропущенный вопрос может сорвать сделку или всплыть уже после закрытия.
Судьи. LAB использует LLM-as-a-judge: Harvey прогоняет оценку многократно по разным семействам моделей и усредняет её. Первые результаты, опубликованные 26 мая на hold-out-наборе (т.е. закрытом, но зеркалящем распределение задач публичного LAB) выглядят так:
Главный и самоочевидный вывод: под строгим all-pass фронтирные модели выполняют менее 10% задач от начала до конца. Ни одна SOTA-модель в агентном харнессе не способна выдать законченный юридический рабочий продукт.
«Неравномерный» интеллект
Второе важное наблюдение Harvey называет термином jagged intelligence (буквально «зазубренный интеллект» — неровные, рваные способности: модель сильна в одном и внезапно слаба в другом). Прирост возможностей распределяется по областям практики неравномерно, и ни одна модель не лидирует везде. Harvey выделяет три равновеликие группы областей, в каждой — свой лидер:
- GPT-5.5 — группа регуляторики и сопровождения запуска бизнеса (emerging-company), где главная составляющая — это поиск и исследование (retrieval-heavy research)
- Opus 4.7 — корпоративные сделки и фонды, где доминируют синтез и аналитика
- Sonnet 4.6 — персональные данные, налоги, частные клиенты, где центральное место занимает структурное сопоставление со статутами и регламентами
То есть единого идеального решения сегодня нет, требуется понимание, какое семейство моделей подходит под задачу. Очень умная мысль вот какая:
Сильнейшие продакшн-развёртывания будут мультимодельными с самого начала.
Стоимость и латентность
Кроме all-pass баллов LAB оценивает стоимость использования моделей. Opus 4.7 — самый дорогой и медленный: около $50,90 за задачу и ~22 минуты. GPT-5.5 примерно втрое дешевле. Gemini 3.5 Flash выдаёт черновик менее чем за шесть минут — почти вчетверо быстрее. Вторая очень умная мысль:
Продакшн-развёртыванию нужен высокий балл внутри бюджета, который клиент готов отдать — сколько долларов он потратит и сколько минут будет ждать черновик.
Запуски на разных харнессах
Harvey запустил LAB намеренно без лидерборда — с объяснением, что датасет будет развиваться и они хотят согласовать с сообществом, как корректно подавать результаты. Поскольку сам бенч опенсорсный, на GitHub выложены код харнесса и часть датасета. Этим воспользовались третьи стороны и стали воспроизводить на своих харнессах. На данный момент есть ещё два независимых прогона одного набора задач:
|
Прогон |
Харнесс |
Лидер (all-pass) |
|
харнесс Vals |
Muse Spark 1.1 — 20,00% |
|
|
Artificial Analysis (LAB-AA) |
Stirrup |
Claude Fable 5 — 14,2% |
Это наглядно иллюстрирует уже ставший общим местом тезис о том, что харнесс важнее модели. Если слово харнесс вас пугает и вызывает непонимание, то можно посмотреть эти материалы в Базе знаний Сообщества Нейросети | ilovedocs: раз, два.
Ещё одна иллюстративная штука: Artificial Analysis опубликовал не только all-pass метрику, но и criterion pass rate (доля набранных критериев), по которой лидер — это Kimi K3 с 94,6%, а по all-pass — Claude Fable 5 с 14,2%. Первая цифра говорит «агент делает почти всё правильно», вторая — «полностью доводит до конца одну задачу из семи».

Если суммировать, то это совершенно впечатляющая работа и стандарт рынка, который ставит Harvey в очень авторитетную позицию: сделать быстро очень сложный бенчмарк для самого актуального на сегодня технического сетапа, запартнёриться с абсолютными лидерами рынка и отдать всё в опенсорс — снимаю шляпу!
Isaacus: построили бенчмарк и выиграли его
Австралийская компания Isaacus выпустила MLEB — Massive Legal Embedding Benchmark, бенчмарк для эмбеддинг-моделей в праве. Напомню, что эмбеддинг-модели — это те самые, что используются для наших любимых RAGов.
Бенч состоит из десяти экспертно размеченных наборов по:
- шести юрисдикциям (США, Великобритания, ЕС, Австралия, Ирландия, Сингапур)
- пяти типам документов (решения, законодательство, регуляторные разъяснения, договоры, доктрина)
- трём типам задач (поиск, zero-shot классификация, вопрос-ответ).
Результат невероятный: первое место занимает Kanon 2 Embedder — модель самого Isaacus (86,03 NDCG@10).
Эти же ребята сделали Legal RAG Bench (в котором снова почему-то победила их модель Kanon 2 Embedder). RAG-бенчмарки — это развлечение на любителя, поэтому я сделаю о них отдельную публикацию попозже, пока просто впишу как иллюстрацию вендорского бенча, в котором победила модель вендора (не оспаривая, что победа может быть и объективна).
Thomson Reuters: saying all the right things, showing nothing
TR — единственный из крупных вендоров, кто последовательно и публично объясняет, как он замеряет свои продукты (то есть CoCounsel). За полтора года вышло пять текстов, и вместе они складываются в довольно-таки полную картину вендорского бенчмаркинга из всех, что есть в открытом доступе. Единственный нюанс — самого бенча и результатов никто никогда не узнает.
Пост первый, октябрь 2024: Trust Team
Этот пост описывает работу Trust Team — команды юристов с разным бэкграундом (инхаус, крупные и малые фирмы, госслужба, публичная политика), которые вручную составляют тесты для CoCounsel, имитируя реальные задачи юристов.
Задача перед экспертами такая:
- Придумать тест, репрезентативный для реальной работы, — исходя из опыта, обратной связи клиентов и вторичных источников
- Самостоятельно выполнить задание — ровно как это сделал бы юрист. Получившийся ответ становится ключом и называется ideal response
- Тест и эталон проходят независимую валидацию (peer review)
- Сотрудник Trust Team прогоняет тест через продукт так же, как пользователь. Результат — model response
- Юрист сравнивает ответ продукта с эталоном по пунктам, оценивая, делают ли расхождения вывод неполным, неверным или вводящим в заблуждение
В этой работе учитывается, что некоторые навыки, например, суммаризация, точнее результат работы, требующий навыка, субъективен по природе. Они не могут быть сведены к «правильно/неправильно», мнения юристов могут расходиться в разумных пределах. Чтобы закрыть этот нюанс, тест считается проваленным, если в ответе сервиса отсутствует хотя бы одна деталь, которую тестировщик счёл критической. По сути это all-pass, но не по всей рубрике, а по подмножеству критических элементов, — тот же принцип, что у Harvey и Vals, найденный независимо и раньше.
«Одиннадцать принципов», февраль 2025: готовый методический чеклист
Пост Майка Дана (глава Westlaw) и Даши Херманновой (TR Labs) — это свод из одиннадцати принципов бенчмаркинга, некоторые из которых мне очень откликаются, например:
- LLM-судья надёжен только на коротких и ясных ответах, на длинных «очень ненадёжен», и требуется комбинирование LLM-оценки и человеческой экспертной валидации
- Для экспертной валидации нужны два независимых оценщика плюс третий арбитр — потому что юристы расходятся в оценке сложных ответов примерно в 25% случаев
- Важно проверять, не ошибочен ли сам эталонный ответ: бывало, что ИИ прав, а эталон неверен
- Оценивать нужно не только бинарно, но и по уровню грубости ошибки: полностью неверный ответ со ссылками, подтверждающими неверный вывод, гораздо хуже, чем корректный ответ с опечаткой в дате цитаты
Апрель 2025: калибровка LLM-судьи
Этот пост — методологически очень содержательный, медятина: там есть и про RAGи и управление большим контекстом, о которых позднее. Для этой публикации мне показалась интересной часть с настройкой LLMaJ.
LLM-судья оценивает задачи по критериям, написанным юристами, для сотен тестов. Каждый тест состоит из трёх частей: пользовательский запрос, один или несколько исходных документов и ideal minimum viable answer — идеальный минимально достаточный ответ, фиксирующий ключевые элементы, без которых ответ бесполезен в юридическом контексте.
Юристы вместе с ML-инженерами пишут для LLMaJ промпты для оценки задач и итеративно их настраивают, проверяя вручную оценки судьи и правя промпты, пока оценки LLM-судьи не сойдутся с оценками юристов-экспертов. В первой части уже было два других способа калибровки судьи: у Vals судья выбирается по согласию с большинством из трёх экспертов, у Legalbenchmarks — по согласию двух судей между собой плюс проверка на кумовство. Это третий, и он, конечно, кажется гораздо более ресурсоёмким.
Ноябрь 2025: Scorecard
Пост Тайлера Александра и Хизер Нодлер описывает Scorecard — платформу для тестирования CoCounsel против критериев, отписанных доменными экспертами-юристы. Эту платформу изначально создали инженеры, делавшие инфраструктуру тестирования беспилотных автомобилей Waymo. На ней проходит регулярное автоматическое тестирование продукта на больших масштабах по постоянно ротирующимся датасетам. Результаты тестирования регулярно верифицируются экспертами-юристами.
Пост главный, провокационный и маркетинговый, май 2026: CoCoBench
CoCoBench начинается с решительной критики: большинство Беней никогда не проектировались под реальную юридическую работу, — это всё какие-то вопросы адвокатского экзамена, извлечение оговорок, одноходовые промпты.
Методологических деталей довольно мало: говорят о сотнях задач от юристов от сотни юристов-практиков, фиксированном датасете для отслеживания динамики качества. Задачи составлены по типам юридической работы — research, drafting, review, multi-step reasoning across workflows. Из методологически примечательного — оценка citation record. Юридические воркфлоу настоящих юристов многошаговые, поэтому оценка не может останавливаться на финальном выходе — система может выдать связный ответ, опираясь на дефектное рассуждение с самого начала. CoCoBench оценивает финальный результат вместе с записью цитирования, которую система произвела по пути: что процитировала, откуда взяла и действительно ли источник подтверждает утверждение.
От поста есть жёсткое маркетинговое ощущение, что он написан для очередного напоминания о том, что их сервис — это Fiduciary-Grade AI (это, ни много ни мало, — зарегистрированный товарный знак). Ни задач, ни критериев, ни тем более результатов CoCoBench в открытом доступе нет; обещан следующий пост с находками, но пока ждём.
LexisNexis: пустота
TR, конечно, молодцы, что делятся, но их позиция выглядит сильно слабее, чем Harvey. Но это всё лучше, чем у LexisNexis, которые вообще отмалчиваются, и ещё по-странному участвуют в других бенчах: например, в феврале 2025 года участвовали в VLAIR, но отозвали своё участие из трёх рейтингов после того, как отчёт был написан.
Ну что ж, имеют право!
Академия, точнее о LegalBench, и почему в 2026 году уже можно дать ему спокойно остаться в истории
Академический бенчмаркинг юридического ИИ, по сути, начался с LegalBench — «первого, насколько известно авторам, опенсорсного бенчмарка юридического рассуждения». Вы могли о нём слышать, ведь его продолжают терзать в русскоязычной публицистике, хотя препринт был аж от августа 2023.
Разбирать его во всех деталях я не смогу, как и практически все остальные академические LegalAI бенчи и аналитические работы в этой области. Ландшафт здесь выглядит так, что всю содержательную работу в этом направлении последние годы ведёт группа исследователей из одного американского университета, которые признан российскими властями нежелательной организацией. Да-да, вы не ослышались, цитирование лигалбенча и всех последующих работ этой группы учёных может тянуть на распространение информационных материалов нежелательной организации.
Относиться к этому можно как угодно, но даже не вдаваясь в методолгию и не давая никаких ссылок давайте расскажу, почему упоминать LegalBench как сколько-нибудь авторитетный источник в 2026 году уже поздновато:
1. Контаминация. Датасет открыт с 2023 года, лежит на HuggingFace. Любая модель 2025–2026 годов с высокой вероятностью видела его в обучающем корпусе, и отличить рассуждение от запоминания невозможно. Любые публичные бенчмарки имеют ограниченную полезность в долгосрочной перспективе из-за рисков намеренной и случайной train-test контаминации.
2. Задачи в бенче — это только задачи с объективно верным ответом. Они не помогают оценивать рассуждение там, где разумные люди могут расходиться, не замеряют юридические навыки. Нужно ли напоминать читателю, что 2 юриста = 3 мнения? Я с самого начала своих мытарств по этой теме топлю за вопросы-кейсы без правильного ответа. Юристу-профессионалу не нужен список экзаменационных вопросов. Этот бенчмарк не спроектирован под реальную юридическую работу — эта критика исходит от Harvey и TR, а не только от меня.
3. Середина 2026 года — эпоха агентного ИИ. Агенты и их харнессы решают вторую проблему, и вообще они становятся техническим стандартом вообще всей бизнесовой AI-среды. Поэтому сет, спроектированный задолго до распространения этой технологии, просто уже не нужен как таковой, а его методологию нужно пересобирать почти с нуля.
Ещё три глубоких и подробных работы были написаны за прошедший год от примерно той же группы учёных. Но их методы и инсайты я не могу цитировать напрямую. Поэтому то, что мне кажется методологически здравым и трансплантируемым на наши реалии, я без атрибуции буду излагать в следующей части — концептуально-методологической. Я вижу, как разные команды чувствуют потребность в юрИИ-бенчах, поэтому надеюсь на особое внимание к следующей части!))