Новость

Anthropic предложила три метрики развития передового AI

Anthropic предложила измерять долю AI в разработке новых моделей, качество надзора за агентами и распределение вычислительных ресурсов внутри передовых лабораторий.

3 мин на чтение
Исследователи анализируют метрики AI в лаборатории со знаком Claude на стеклянной перегородке

Главное

Коротко: Anthropic опубликовала три группы показателей, которые, по мнению компании, помогут наблюдать за темпом разработки передовых AI-систем. Они описывают участие AI в собственных исследованиях лаборатории, возможность контролировать действия агентов и распределение вычислительных ресурсов.

Публикация не является анонсом новой версии Claude и не меняет доступность чат-бота. Текущая работа сервиса отображается на странице Claude, а отдельная новость о внешней оценке моделей доступна в материале о партнёрстве Anthropic и Accenture.

В материале
  1. Какие три показателя предлагает Anthropic
  2. Что Anthropic сообщила о своей работе
  3. Зачем отслеживать надзор за агентами
  4. Почему важен учёт вычислений
  5. Что пока нельзя заключить из публикации
  6. Что будет признаком реальной прозрачности

Какие три показателя предлагает Anthropic

  1. Участие AI в исследованиях и разработке. Компания предлагает оценивать, какую долю задач выполняют люди, какую AI выполняет совместно с человеком и в каких случаях система ведёт задачу от общего запроса до результата под надзором специалиста.
  2. Надзор за агентами. Отдельная группа показателей должна отражать, насколько хорошо люди и автоматические системы видят действия AI-агентов, могут остановить их и разбирают ошибки.
  3. Вычислительные ресурсы. Третья группа описывает, какая часть ускорителей и инфраструктуры используется для обучения, исследований, внутренней работы и обслуживания пользователей.

Что Anthropic сообщила о своей работе

Компания пишет, что в августе 2026 года Claude не работал полностью автономно ни в одной из измеренных групп задач по AI-разработке. При этом, по внутренней оценке Anthropic, Claude вёл 26% таких задач, а доля работы на уровне совместного участия AI или выше превышала 90%.

Эти значения нельзя автоматически переносить на другие лаборатории. Anthropic использовала собственную методику и собственные модели для части оценки, поэтому признаёт риск систематических ошибок. Для сравнения компаний потребуются общие определения, повторяемые измерения и внешняя проверка.

Зачем отслеживать надзор за агентами

Число выполненных задач само по себе не показывает, насколько безопасно работает агент. Важны полнота журналов, возможность вмешательства, качество автоматических проверок и скорость реакции человека. Anthropic предлагает публиковать такие показатели вместе с данными об участии AI в разработке.

Похожий вопрос затрагивает программа встроенных оценщиков. В отличие от новой публикации о метриках, она описывает доступ внешней команды к процессам разработки. Вместе эти инициативы могут дать более проверяемую картину только после появления регулярных отчётов и независимой верификации.

Почему важен учёт вычислений

Данные о вычислительных ресурсах могут показать, какая часть инфраструктуры направлена на создание более мощных моделей, внутренние AI-инструменты и обслуживание уже выпущенных продуктов. Но без единой классификации такие числа трудно сравнивать: разные компании могут по-разному относить один и тот же процесс к обучению, исследованиям или инференсу.

Что пока нельзя заключить из публикации

  • метрики не доказывают безопасность конкретной версии модели;
  • внутренняя оценка не равна независимому аудиту;
  • процент автоматизации не измеряет качество каждого результата;
  • прогноз дальнейшего роста не является гарантией;
  • методика одной компании пока не позволяет напрямую сравнить всю отрасль.

Для понимания возможностей конкурирующих моделей можно обратиться к разбору GPT-6 Astra. Сравнивать заявления разработчиков корректно только при совпадающих задачах, наборах тестов и правилах проверки.

Что будет признаком реальной прозрачности

Практическая ценность предложения появится, если показатели будут публиковаться регулярно, методика останется доступной, изменения определений будут видны, а внешние специалисты смогут проверить данные. Пока Anthropic представила исходный набор измерений и собственный снимок, а не отраслевой стандарт.

Новости и разборы