Возможности моделей

Сравните модели по восьми измерениям: от интеллекта до стоимости использования и скорости отклика.

01

Общий интеллект

Сравните общие способности к рассуждению, программированию и интеллектуальной работе.

© Artificial Analysis · 2026-09-27Intelligence Index v4.3.2
Выше — лучше. Индекс объединяет 10 оценок; это сравнительный балл, а не доля решённых задач.

Интерпретация графика

В этой выборке Opus 5.5 лидирует с 58; Fable 5.1 и GPT-6 Astra округляются до 53. Учитывайте настройки рассуждения.

02

Специализированные оценки

Отдельно изучите программирование, рассуждение, фактические знания, длинный контекст и визуальное мышление.

Показать 19 графиков оценок19 оценок · разные шкалы

Интерпретация графика

Лидеры зависят от задачи: код — Terminal-Bench и SciCode, длинный контекст — AA-LCR, визуальное рассуждение — MMMU-Pro.

03

Агенты для интеллектуальной работы

Оцените способность агента превратить сложное задание в полезный результат.

© Artificial Analysis · 2026-09-27AA-Briefcase v1.1 · Elo
Выше — лучше. AA-Briefcase объединяет выполнение критериев, качество анализа и представления. Инструменты и настройки агента влияют на результат.

Интерпретация графика

В этой выборке Opus 5.5 достигает 1822 Elo, Fable 5.1 — 1678, Grok 4.7 — 1657.

04

Интеллект и стоимость

Найдите нужные возможности при приемлемой стоимости задачи.

© Artificial Analysis · 2026-09-27Индекс интеллекта · USD/задача · логарифмическая шкала
Стоимость — взвешенная цена тестовой задачи с учётом токенов. Горизонтальная шкала логарифмическая. Это не тарифы API этого сайта.

Интерпретация графика

Левая верхняя область сочетает высокие способности и низкую стоимость. Пунктирная граница помогает найти эффективные варианты в выборке.

05

Эффективность токенов

Узнайте расход токенов рассуждения и ответа на одну тестовую задачу.

© Artificial Analysis · 2026-09-27Взвешенные выходные токены/задача
Меньший расход может сократить стоимость и ожидание, но не доказывает лучшее качество. Учитывайте интеллект и цены токенов.

Интерпретация графика

Opus 5.5 расходует около 119k выходных токенов на задачу, GPT-6 Sol — 31k. Значительная доля приходится на рассуждение.

06

Объём контекста

Сравните доступный объём для документов, кода и истории диалога.

© Artificial Analysis · 2026-09-27Контекстное окно · токены
Большое окно — предел объёма, а не доказательство лучшего понимания. Проверьте AA-LCR и ограничения ввода/вывода поставщика.

Интерпретация графика

Многие модели в выборке предлагают контекст около 1M токенов; Grok 4.7 — 500k, Mistral Medium 3.5 — 256k.

07

Скорость генерации

Сравните скорость поступления текста после начала генерации.

© Artificial Analysis · 2026-09-27Выходные токены/секунду · вход 10k токенов · один запрос
Выше — лучше. Скорость не включает ожидание начала вывода; это не полное время задачи и не гарантия пропускной способности сайта.

Интерпретация графика

В выборке Gemini 3.5 Flash-Lite достигает 337 токенов/с, Gemini 3.8 Flash при high — 285. Высокая скорость полезна для длинных ответов.

08

Время до начала ответа

Измерьте ожидание первого токена ответа для пользователя.

© Artificial Analysis · 2026-09-27Секунды · включая размышление · вход 10k токенов · один запрос
Ниже — лучше. Метрика включает рассуждение и отличается от времени до первого токена. Сопоставляйте одинаковые настройки и поставщиков API.

Интерпретация графика

Grok 4.7 при xhigh показывает 54,4 с, GPT-6 Astra при max — 292,2 с. Размышление может составлять основную часть ожидания.

Сохранены выбор моделей и настройки источника. Отсутствие модели или измерения не означает нулевую оценку.

Оригинальные графики: Artificial Analysis. Комментарии — редакционные рекомендации; важные решения проверяйте на собственных задачах.