Legal AI Benchmarking: как это делают там. Часть 2: вендоры и...

Вторая часть большого обзора о том, как на западном рынке оценивают AI-продукты на юридических задачах.

В первой части речь шла о независимых фасилитаторах — тех, кто пытается проводить объективные замеры в интересах сообщества. 

Сегодня в номере: что нам известно о том, как западные провайдеры юридических ИИ-сервисов измеряют собственное качество. Я обещала ещё и об академическом взгляде на бенчмаркинг, но почти ничего не будет — а почему так, узнаете ближе к концу!

Вендоры: кто меряет себя сам

LAB — это опенсорсный агентный бенчмарк от самого известного провайдера юридического ИИ-сервиса, анонсированный 6 мая 2026. Список партнёров не просто внушительный, а совершенно недостижимый — там и Anthropic, и NVIDIA, и Google DeepMind… Первые результаты опубликовали 26 мая.

Harvey начинает с диагноза существующих бенчмарков, называя поимённо, включая свой собственный: LegalBench, CUAD, LEXam и собственный более ранний BigLaw Bench. Все они измеряют короткое рассуждение — прочитать договор, ответить на вопрос, сравнить дела, разобрать аргумент. LAB задуман мерить другое: не ответ на вопрос, а единицу работы, которую в фирме реально делегируют ассоциату — client matter.

Исходя из идеологии client matter-centric benchmark, каждое задание собрано из четырёх элементов, воспроизводящих поручение партнёра ассоциату:

  1. Инструкция — написана как запрос партнёра. Короткая (в среднем около 50 слов) и сформулирована через «что нужно», а не «как это сделать»
  2. Среда (Environment) — клиентское дело: набор документов в песочнице. Существенно, что туда намеренно кладут и релевантные файлы, и посторонние, которые агент должен научиться игнорировать
  3. Результат (Output) — не просто ответ на вопрос, а поддающийся проверке (reviewable) рабочий продукт юриста: меморандум, disclosure schedule, саммари позиции
  4. Верификация — экспертная рубрика, разбивающая продукт на атомарные критерии pass/fail, покрывающие факты, выводы, цитирования, структурные требования и аналитические ходы, которые обязан содержать проходной ответ
Источник

Масштаб

  • 1 251 задача
  • 24 области юридической практики, т.е. не совсем отрасли права, а то, как обычно называются практики в юридических фирмах: от Data Privacy and Cybersecurity до International Trade and Sanctions
  • больше 76 000 бинарных критериев

Медиана — 7 исходных документов и 57 критериев на задачу. 

Пример задачи, который разбирает LawSites: поглощение Crestview Software Solutions за $458 млн полностью акциями. Агент должен проработать виртуальную комнату данных — восемь материальных договоров плюс сопутствующие документы, и найти положения о смене контроля по всему массиву, оценить риск сделки, предложить дальнейшие шаги и подготовить проект меморандума для команды сделки и совета директоров. Рубрика этой одной задачи — 57 критериев, покрывающих девять правовых проблем, разложенных по материалам.

Оценка — all-pass: если не читали первую часть цикла, то это означает, что задача засчитана, только если пройден каждый критерий, частичного зачёта нет. Harvey обосновывает all-pass критерий таким образом, что меморандум по сделке, поймавший восемь материальных рисков из десяти, полезен не на 80%. Один пропущенный вопрос может сорвать сделку или всплыть уже после закрытия.

Судьи. LAB использует LLM-as-a-judge: Harvey прогоняет оценку многократно по разным семействам моделей и усредняет её. Первые результаты, опубликованные 26 мая на hold-out-наборе (т.е. закрытом, но зеркалящем распределение задач публичного LAB) выглядят так:

Источник

Главный и самоочевидный вывод: под строгим all-pass фронтирные модели выполняют менее 10% задач от начала до конца. Ни одна SOTA-модель в агентном харнессе не способна выдать законченный юридический рабочий продукт.

«Неравномерный» интеллект

Второе важное наблюдение Harvey называет термином jagged intelligence (буквально «зазубренный интеллект» — неровные, рваные способности: модель сильна в одном и внезапно слаба в другом). Прирост возможностей распределяется по областям практики неравномерно, и ни одна модель не лидирует везде. Harvey выделяет три равновеликие группы областей, в каждой — свой лидер:

  • GPT-5.5 — группа регуляторики и сопровождения запуска бизнеса (emerging-company), где главная составляющая — это поиск и исследование (retrieval-heavy research)
  • Opus 4.7 — корпоративные сделки и фонды, где доминируют синтез и аналитика
  • Sonnet 4.6 — персональные данные, налоги, частные клиенты, где центральное место занимает структурное сопоставление со статутами и регламентами

То есть единого идеального решения сегодня нет, требуется понимание, какое семейство моделей подходит под задачу. Очень умная мысль вот какая:

Сильнейшие продакшн-развёртывания будут мультимодельными с самого начала.

Стоимость и латентность

Кроме all-pass баллов LAB оценивает стоимость использования моделей. Opus 4.7 — самый дорогой и медленный: около $50,90 за задачу и ~22 минуты. GPT-5.5 примерно втрое дешевле. Gemini 3.5 Flash выдаёт черновик менее чем за шесть минут — почти вчетверо быстрее. Вторая очень умная мысль:

Продакшн-развёртыванию нужен высокий балл внутри бюджета, который клиент готов отдать — сколько долларов он потратит и сколько минут будет ждать черновик.

Запуски на разных харнессах

Harvey запустил LAB намеренно без лидерборда — с объяснением, что датасет будет развиваться и они хотят согласовать с сообществом, как корректно подавать результаты. Поскольку сам бенч опенсорсный, на GitHub выложены код харнесса и часть датасета. Этим воспользовались третьи стороны и стали воспроизводить на своих харнессах. На данный момент есть ещё два независимых прогона одного набора задач:

Прогон

Харнесс

Лидер (all-pass)

Vals AI

харнесс Vals

Muse Spark 1.1 — 20,00%

Artificial Analysis (LAB-AA)

Stirrup

Claude Fable 5 — 14,2%

Это наглядно иллюстрирует уже ставший общим местом тезис о том, что харнесс важнее модели. Если слово харнесс вас пугает и вызывает непонимание, то можно посмотреть эти материалы в Базе знаний Сообщества Нейросети | ilovedocs: раз, два

Ещё одна иллюстративная штука: Artificial Analysis опубликовал не только all-pass метрику, но и criterion pass rate (доля набранных критериев), по которой лидер — это Kimi K3 с 94,6%, а по all-pass — Claude Fable 5 с 14,2%. Первая цифра говорит «агент делает почти всё правильно», вторая — «полностью доводит до конца одну задачу из семи». 

Источник

Если суммировать, то это совершенно впечатляющая работа и стандарт рынка, который ставит Harvey в очень авторитетную позицию: сделать быстро очень сложный бенчмарк для самого актуального на сегодня технического сетапа, запартнёриться с абсолютными лидерами рынка и отдать всё в опенсорс — снимаю шляпу!

 Isaacus: построили бенчмарк и выиграли его

Австралийская компания Isaacus выпустила MLEB — Massive Legal Embedding Benchmark, бенчмарк для эмбеддинг-моделей в праве. Напомню, что эмбеддинг-модели — это те самые, что используются для наших любимых RAGов. 

Бенч состоит из десяти экспертно размеченных наборов по: 

  • шести юрисдикциям (США, Великобритания, ЕС, Австралия, Ирландия, Сингапур)
  • пяти типам документов (решения, законодательство, регуляторные разъяснения, договоры, доктрина)
  • трём типам задач (поиск, zero-shot классификация, вопрос-ответ).

Результат невероятный: первое место занимает Kanon 2 Embedder — модель самого Isaacus (86,03 NDCG@10).

Эти же ребята сделали Legal RAG Bench (в котором снова почему-то победила их модель Kanon 2 Embedder). RAG-бенчмарки — это развлечение на любителя, поэтому я сделаю о них отдельную публикацию попозже, пока просто впишу как иллюстрацию вендорского бенча, в котором победила модель вендора (не оспаривая, что победа может быть и объективна). 

Thomson Reuters: saying all the right things, showing nothing

TR — единственный из крупных вендоров, кто последовательно и публично объясняет, как он замеряет свои продукты (то есть CoCounsel). За полтора года вышло пять текстов, и вместе они складываются в довольно-таки полную картину вендорского бенчмаркинга из всех, что есть в открытом доступе. Единственный нюанс — самого бенча и результатов никто никогда не узнает. 

Пост первый, октябрь 2024: Trust Team

Этот пост описывает работу Trust Team — команды юристов с разным бэкграундом (инхаус, крупные и малые фирмы, госслужба, публичная политика), которые вручную составляют тесты для CoCounsel, имитируя реальные задачи юристов.

Задача перед экспертами такая:

  1. Придумать тест, репрезентативный для реальной работы, — исходя из опыта, обратной связи клиентов и вторичных источников
  2. Самостоятельно выполнить задание — ровно как это сделал бы юрист. Получившийся ответ становится ключом и называется ideal response
  3. Тест и эталон проходят независимую валидацию (peer review
  4. Сотрудник Trust Team прогоняет тест через продукт так же, как пользователь. Результат — model response
  5. Юрист сравнивает ответ продукта с эталоном по пунктам, оценивая, делают ли расхождения вывод неполным, неверным или вводящим в заблуждение

В этой работе учитывается, что некоторые навыки, например, суммаризация, точнее результат работы, требующий навыка, субъективен по природе. Они не могут быть сведены к «правильно/неправильно», мнения юристов могут расходиться в разумных пределах. Чтобы закрыть этот нюанс, тест считается проваленным, если в ответе сервиса отсутствует хотя бы одна деталь, которую тестировщик счёл критической. По сути это all-pass, но не по всей рубрике, а по подмножеству критических элементов, — тот же принцип, что у Harvey и Vals, найденный независимо и раньше.

«Одиннадцать принципов», февраль 2025: готовый методический чеклист

Пост Майка Дана (глава Westlaw) и Даши Херманновой (TR Labs) — это свод из одиннадцати принципов бенчмаркинга, некоторые из которых мне очень откликаются, например:

  • LLM-судья надёжен только на коротких и ясных ответах, на длинных «очень ненадёжен», и требуется комбинирование LLM-оценки и человеческой экспертной валидации
  • Для экспертной валидации нужны два независимых оценщика плюс третий арбитр — потому что юристы расходятся в оценке сложных ответов примерно в 25% случаев
  • Важно проверять, не ошибочен ли сам эталонный ответ: бывало, что ИИ прав, а эталон неверен
  • Оценивать нужно не только бинарно, но и по уровню грубости ошибки: полностью неверный ответ со ссылками, подтверждающими неверный вывод, гораздо хуже, чем корректный ответ с опечаткой в дате цитаты

Апрель 2025: калибровка LLM-судьи

Этот пост — методологически очень содержательный, медятина: там есть и про RAGи и управление большим контекстом, о которых позднее. Для этой публикации мне показалась интересной часть с настройкой LLMaJ. 

LLM-судья оценивает задачи по критериям, написанным юристами, для сотен тестов. Каждый тест состоит из трёх частей: пользовательский запрос, один или несколько исходных документов и ideal minimum viable answer — идеальный минимально достаточный ответ, фиксирующий ключевые элементы, без которых ответ бесполезен в юридическом контексте.

Юристы вместе с ML-инженерами пишут для LLMaJ промпты для оценки задач и итеративно их настраивают, проверяя вручную оценки судьи и правя промпты, пока оценки LLM-судьи не сойдутся с оценками юристов-экспертов. В первой части уже было два других способа калибровки судьи: у Vals судья выбирается по согласию с большинством из трёх экспертов, у Legalbenchmarks — по согласию двух судей между собой плюс проверка на кумовство. Это третий, и он, конечно, кажется гораздо более ресурсоёмким.

Ноябрь 2025: Scorecard

Пост Тайлера Александра и Хизер Нодлер описывает Scorecard — платформу для тестирования CoCounsel против критериев, отписанных доменными экспертами-юристы. Эту платформу  изначально создали инженеры, делавшие инфраструктуру тестирования беспилотных автомобилей Waymo. На ней проходит регулярное автоматическое тестирование продукта на больших масштабах по постоянно ротирующимся датасетам. Результаты тестирования регулярно верифицируются экспертами-юристами. 

Пост главный, провокационный и маркетинговый, май 2026: CoCoBench

CoCoBench начинается с решительной критики: большинство Беней никогда не проектировались под реальную юридическую работу, — это всё какие-то вопросы адвокатского экзамена, извлечение оговорок, одноходовые промпты. 

Методологических деталей довольно мало: говорят о сотнях задач от юристов от сотни юристов-практиков, фиксированном датасете для отслеживания динамики качества. Задачи составлены по типам юридической работы — research, drafting, review, multi-step reasoning across workflows.  Из методологически примечательного — оценка citation record. Юридические воркфлоу настоящих юристов многошаговые, поэтому оценка не может останавливаться на финальном выходе — система может выдать связный ответ, опираясь на дефектное рассуждение с самого начала. CoCoBench оценивает финальный результат вместе с записью цитирования, которую система произвела по пути: что процитировала, откуда взяла и действительно ли источник подтверждает утверждение.

От поста есть жёсткое маркетинговое ощущение, что он написан для очередного напоминания о том, что их сервис — это Fiduciary-Grade AI (это, ни много ни мало, — зарегистрированный товарный знак). Ни задач, ни критериев, ни тем более результатов CoCoBench в открытом доступе нет; обещан следующий пост с находками, но пока ждём.

LexisNexis: пустота

TR, конечно, молодцы, что делятся, но их позиция выглядит сильно слабее, чем Harvey. Но это всё лучше, чем у LexisNexis, которые вообще отмалчиваются, и ещё по-странному участвуют в других бенчах: например, в феврале 2025 года участвовали в VLAIR, но отозвали своё участие из трёх рейтингов после того, как отчёт был написан.

Ну что ж, имеют право! 

Академия, точнее о LegalBench, и почему в 2026 году уже можно дать ему спокойно остаться в истории

Академический бенчмаркинг юридического ИИ, по сути, начался с LegalBench — «первого, насколько известно авторам, опенсорсного бенчмарка юридического рассуждения». Вы могли о нём слышать, ведь его продолжают терзать в русскоязычной публицистике, хотя препринт был аж от августа 2023. 

Разбирать его во всех деталях я не смогу, как и практически все остальные академические LegalAI бенчи и аналитические работы в этой области. Ландшафт здесь выглядит так, что всю содержательную работу в этом направлении последние годы ведёт группа исследователей из одного американского университета, которые признан российскими властями нежелательной организацией. Да-да, вы не ослышались, цитирование лигалбенча и всех последующих работ этой группы учёных может тянуть на распространение информационных материалов нежелательной организации. 

Относиться к этому можно как угодно, но даже не вдаваясь в методолгию и не давая никаких ссылок давайте расскажу, почему упоминать LegalBench как сколько-нибудь авторитетный источник в 2026 году уже поздновато:

1. Контаминация. Датасет открыт с 2023 года, лежит на HuggingFace. Любая модель 2025–2026 годов с высокой вероятностью видела его в обучающем корпусе, и отличить рассуждение от запоминания невозможно. Любые публичные бенчмарки имеют ограниченную полезность в долгосрочной перспективе из-за рисков намеренной и случайной train-test контаминации.

2. Задачи в бенче — это только задачи с объективно верным ответом. Они не помогают оценивать рассуждение там, где разумные люди могут расходиться, не замеряют юридические навыки. Нужно ли напоминать читателю, что 2 юриста = 3 мнения? Я с самого начала своих мытарств по этой теме топлю за вопросы-кейсы без правильного ответа. Юристу-профессионалу не нужен список экзаменационных вопросов. Этот бенчмарк не спроектирован под реальную юридическую работу — эта критика исходит от Harvey и TR, а не только от меня.

3. Середина 2026 года — эпоха агентного ИИ. Агенты и их харнессы решают вторую проблему, и вообще они становятся техническим стандартом вообще всей бизнесовой AI-среды. Поэтому сет, спроектированный задолго до распространения этой технологии, просто уже не нужен как таковой, а его методологию нужно пересобирать почти с нуля. 

Ещё три глубоких и подробных работы были написаны за прошедший год от примерно той же группы учёных. Но их методы и инсайты я не могу цитировать напрямую. Поэтому то, что мне кажется методологически здравым и трансплантируемым на наши реалии, я без атрибуции буду излагать в следующей части — концептуально-методологической. Я вижу, как разные команды чувствуют потребность в юрИИ-бенчах, поэтому надеюсь на особое внимание к следующей части!))