Новость
Anthropic предложила три метрики развития передового AI
Anthropic предложила измерять долю AI в разработке новых моделей, качество надзора за агентами и распределение вычислительных ресурсов внутри передовых лабораторий.
Главное
Коротко: Anthropic опубликовала три группы показателей, которые, по мнению компании, помогут наблюдать за темпом разработки передовых AI-систем. Они описывают участие AI в собственных исследованиях лаборатории, возможность контролировать действия агентов и распределение вычислительных ресурсов.
Публикация не является анонсом новой версии Claude и не меняет доступность чат-бота. Текущая работа сервиса отображается на странице Claude, а отдельная новость о внешней оценке моделей доступна в материале о партнёрстве Anthropic и Accenture.
В материале
Какие три показателя предлагает Anthropic
- Участие AI в исследованиях и разработке. Компания предлагает оценивать, какую долю задач выполняют люди, какую AI выполняет совместно с человеком и в каких случаях система ведёт задачу от общего запроса до результата под надзором специалиста.
- Надзор за агентами. Отдельная группа показателей должна отражать, насколько хорошо люди и автоматические системы видят действия AI-агентов, могут остановить их и разбирают ошибки.
- Вычислительные ресурсы. Третья группа описывает, какая часть ускорителей и инфраструктуры используется для обучения, исследований, внутренней работы и обслуживания пользователей.
Что Anthropic сообщила о своей работе
Компания пишет, что в августе 2026 года Claude не работал полностью автономно ни в одной из измеренных групп задач по AI-разработке. При этом, по внутренней оценке Anthropic, Claude вёл 26% таких задач, а доля работы на уровне совместного участия AI или выше превышала 90%.
Эти значения нельзя автоматически переносить на другие лаборатории. Anthropic использовала собственную методику и собственные модели для части оценки, поэтому признаёт риск систематических ошибок. Для сравнения компаний потребуются общие определения, повторяемые измерения и внешняя проверка.
Зачем отслеживать надзор за агентами
Число выполненных задач само по себе не показывает, насколько безопасно работает агент. Важны полнота журналов, возможность вмешательства, качество автоматических проверок и скорость реакции человека. Anthropic предлагает публиковать такие показатели вместе с данными об участии AI в разработке.
Похожий вопрос затрагивает программа встроенных оценщиков. В отличие от новой публикации о метриках, она описывает доступ внешней команды к процессам разработки. Вместе эти инициативы могут дать более проверяемую картину только после появления регулярных отчётов и независимой верификации.
Почему важен учёт вычислений
Данные о вычислительных ресурсах могут показать, какая часть инфраструктуры направлена на создание более мощных моделей, внутренние AI-инструменты и обслуживание уже выпущенных продуктов. Но без единой классификации такие числа трудно сравнивать: разные компании могут по-разному относить один и тот же процесс к обучению, исследованиям или инференсу.
Что пока нельзя заключить из публикации
- метрики не доказывают безопасность конкретной версии модели;
- внутренняя оценка не равна независимому аудиту;
- процент автоматизации не измеряет качество каждого результата;
- прогноз дальнейшего роста не является гарантией;
- методика одной компании пока не позволяет напрямую сравнить всю отрасль.
Для понимания возможностей конкурирующих моделей можно обратиться к разбору GPT-6 Astra. Сравнивать заявления разработчиков корректно только при совпадающих задачах, наборах тестов и правилах проверки.
Что будет признаком реальной прозрачности
Практическая ценность предложения появится, если показатели будут публиковаться регулярно, методика останется доступной, изменения определений будут видны, а внешние специалисты смогут проверить данные. Пока Anthropic представила исходный набор измерений и собственный снимок, а не отраслевой стандарт.