Методика: как мы собираем и сравниваем данные

Откуда берутся числа на страницах моделей и рейтингов, как часто они обновляются и как их читать. У каждого значения на сайте есть источник и дата наблюдения; неизвестное показывается как «не установлено».

Методика

Источники

  • R01 — каталог моделей OpenRouter (/api/v1/models и каталоги изображений, видео, эмбеддингов): идентификатор, контекст, лимит вывода, модальности, цены за 1M токенов, уровни усилия. Обновление каждые 6 часов.
  • R02 — endpoints провайдеров OpenRouter: цена, контекст и лимит вывода у каждого провайдера отдельно. Цена и контекст в паспорте всегда берутся из одного endpoint.
  • R03 — image endpoints OpenRouter: цена за изображение.
  • R05 — OpenRouter rankings (/datasets/rankings-daily, CC BY 4.0): токены по моделям по дням и неделям, топ-K моделей плюс строка «other». Доля модели = её токены / (топ-K + other). Выпадение из топ-K показывается разрывом ряда, не нулём.
  • R08 — датасет arena (lmarena-ai/leaderboard-dataset, CC BY 4.0): 11 бордов с историей снимков. Оценка (Elo-подобный рейтинг Брэдли — Терри), нижняя и верхняя границы интервала, число голосов и место воспроизводятся из снимка без пересчёта. Для борда «Агенты» источник публикует долю успеха и её интервал.
  • R11 — сводные индексы Artificial Analysis (через поле benchmarks каталога OpenRouter): индексы интеллекта, программирования и агентных задач; место считается среди моделей с индексом в последнем наблюдении.
  • R12 — Design Arena (через каталог OpenRouter): рейтинг, доля побед и место по категориям дизайна и вёрстки; воспроизводятся без пересчёта.
  • R13 — замеры OpenRouter на площадках провайдеров (страницы моделей): GPQA Diamond и τ-bench по каждому провайдеру с числом прогонов; на странице показан диапазон по площадкам.
  • R10 — ручные паспорта: документация разработчика, для каждого факта — ссылка на страницу-источник и дата наблюдения. Так описаны модели, которых нет в каталоге OpenRouter (в том числе российские).

Что означает число

  • Рейтинг arena — оценка предпочтений людей в парных сравнениях анонимных ответов. Единица выборки — голос. Интервал показывает неопределённость оценки при данном числе голосов; интервал не равен диапазону мест: модель на 3-м месте с интервалом, пересекающим интервал 1-го, статистически от него неотличима.
  • Место — порядковый номер в снимке; при появлении новых моделей место меняется без изменения качества самой модели, поэтому мы показываем и оценку, и дату снимка.
  • Доля использования — доля токенов модели среди всех запросов через OpenRouter за день или неделю. Это популярность у разработчиков на одной площадке, а не качество и не рынок целиком.
  • Цена — долларов за миллион токенов входа и выхода у конкретного провайдера или по каталогу; переменные и «бесплатные» маршруты помечаются отдельно. Неизвестное значение показывается как «не установлено», не как ноль.

Как устроены страницы

  • Каждый блок с данными подписан источником и датой; у каждого факта хранится хеш исходного ответа и ревизия — при изменении значения старая ревизия сохраняется.
  • Страница модели открывается для индексации, когда есть паспорт, хотя бы одно измерение (строка arena или наблюдённое использование) и текст, проверенный редактором. Открытая страница не закрывается и не переезжает: адреса постоянны.
  • Имена моделей в разных источниках сопоставляются реестром алиасов с датами действия; неизвестное имя никогда не привязывается «к ближайшему» автоматически.
  • Ряды истории и агрегаты рейтингов публикуются в машиночитаемом виде: /ai-data/.

Технические журналы запусков коллектора: данные и запуски.

Смысл числа

Рейтинг по оценкам людей
оценка предпочтений в парных сравнениях; единица — голос; интервал — неопределённость оценки, не диапазон мест
Доля токенов
токены модели среди всех наблюдённых токенов за окно запросов через API-агрегаторы; топ-K плюс «прочие»
Цена
долларов за 1M токенов входа и выхода; «не установлено» — источник не сообщил значение

Источники

Как мы собираем и сравниваем данные