Модель отвечает на «кто ты?» тем, что ей написали в системном промпте. В исследовании Калифорнийского университета в Беркли модели, которым подменили системный промпт, правильно называли себя почти в 0 % случаев (arXiv 2504.04715). Посредник, который подменяет модель, этот промпт и пишет.
Проверять приходится поведением и учётом. Ниже семь таких проверок.
Что подсовывают вместо заявленной модели
Исследователи CISPA проверили 24 адреса у трёх посредников, которыми пользовались авторы научных статей. В 45,83 % случаев «отпечаток» модели не совпал с заявленным (arXiv 2603.01919). В работе описаны три вида подмены:
- Другая модель. Запросы к GPT-5 по отпечатку оказались ближе всего к небольшой открытой GLM-4-9B.
- Модель без рассуждений вместо модели с рассуждениями. Вместо DeepSeek-Reasoner отвечал DeepSeek-Chat, и точность на олимпиадных задачах заметно падала.
- Та же модель, но урезанная. Gemini 2.5 Flash проходила проверку отпечатка, но на медицинских тестах MedQA давала около 37 % правильных ответов против 83,82 % у официального API. Авторы предполагают обрезанный контекст, изменённые параметры или скрытую обработку промпта.
Сжатая версия (FP8, FP4) — это про открытые модели: DeepSeek, Qwen, Kimi, GLM. Веса Claude и GPT закрыты, сжать их посредник не может. Сжатие само по себе не обман, если провайдер о нём пишет. Если не пишет, по ответам его не поймать: классификаторы отличали сжатые до FP8 и INT8 модели от исходных примерно в 50 % случаев, то есть не лучше подброшенной монеты (arXiv 2504.04715). В каталоге LLMFinder сжатые версии помечены, а фильтр «Без сжатых версий» убирает их из сравнения.
1. Цена
Официальная цена Claude Sonnet 5.5 — $2 за миллион входных токенов, это 166,49 ₽ по курсу ЦБ на 2 октября 2026 года. У провайдеров из каталога вход стоит от 166,49 до 600 ₽ (страница модели).
Если закрытая модель стоит дешевле 70 % официальной и провайдер не объясняет скидку, каталог помечает предложение «ниже официальной» и не считает его самой низкой ценой. На 2 октября 2026 года такая пометка стоит у 6 предложений из 1070. Честных причин для такой скидки две: отложенная обработка (batch, flex) и кэширование промптов. Подробнее о них в статье «Почему Claude и GPT продают в 10 раз дешевле официальной цены».
Обратное неверно: высокая цена честность не доказывает. В исследовании CISPA соотношение цены посредника к официальной никак не предсказывало, насколько хуже окажутся ответы.
2. Длина контекста
У Claude Sonnet 5.5 контекст — миллион токенов. Урезанный контекст экономит посреднику деньги: длинный запрос обрезается, а модель отвечает по тому, что осталось. Если провайдер сам заявляет меньший контекст, проверяйте его цифру.
Проверка: возьмите длинный документ, вставьте в самое начало проверочный факт, например «код склада — 4471», и в конце спросите про него. Начните со 100 тысяч токенов и дойдите до 300 тысяч. Настоящая модель найдёт факт, урезанная ответит наугад или вернёт ошибку о длине запроса. Прогон на 300 тысячах входных токенов Claude Sonnet 5.5 стоит от 50 до 180 ₽ в зависимости от провайдера (цены на 2 октября 2026 года).
3. Счёт токенов
Посредник сам сообщает, сколько токенов вы потратили, и по этому числу списывает деньги. Проверить его можно.
Для GPT счётчик открыт: библиотека OpenAI tiktoken для GPT-4o, GPT-4.1 и семейства GPT-5 использует кодировку o200k_base. Посчитайте токены своего запроса локально и сравните с полем usage.prompt_tokens в ответе. Расхождение в несколько токенов нормально: служебная разметка сообщений тоже считается. Расхождение на десятки процентов — повод разбираться.
Для Claude у Anthropic есть бесплатный метод count_tokens, но он требует ключа и даёт оценку, а не точное число. Практичнее отправить один и тот же текст нескольким провайдерам и сравнить input_tokens: числа должны почти совпасть.
Стимул завышать счёт есть. Исследователи из Института Макса Планка показали, что при оплате за токен провайдеру выгодно завышать их число, а пользователь не может это доказать (arXiv 2505.21627). В работе CISPA число токенов у части посредников действительно расходилось с официальным API.
4. Вызов инструментов
Ошибки в вызове функций легко посчитать: модель зовёт инструмент не там, где официальный API, или присылает JSON с аргументами, который не проходит схему. Для агентов вроде Claude Code такие ошибки ломают работу.
Так сторонних провайдеров своей модели проверяет Moonshot, разработчик Kimi. Её открытый K2 Vendor Verifier прогоняет у каждого провайдера одни и те же запросы и считает две вещи: вызвала ли модель инструмент там же, где официальный API, и проходит ли JSON проверку по схеме. У официального API Kimi K2 0905 по схеме проходит 100 % вызовов, у некоторых сторонних площадок — около 72 %.
Для Claude и GPT можно сделать то же вручную: 20–30 запросов с описанием двух-трёх инструментов, ответы эталона и проверяемого провайдера сравнить по тем же двум признакам.
5. Скорость и поток
Замерьте время до первого токена и скорость генерации в токенах в секунду, а потом повторите в другой день. Скорость зависит и от нагрузки, поэтому смотрите на разброс, а не на одно число. Если она прыгает в разы, запросы могут уходить в разные модели.
Исследователи CISPA предлагают порог: провести не меньше трёх сессий на одном наборе задач и насторожиться, если разброс точности больше 5 процентных пунктов или коэффициент вариации задержки больше 0,15.
6. Подпись рассуждений у Claude
Когда у Claude включено мышление (thinking), каждый блок рассуждений приходит с полем signature — зашифрованной копией полных рассуждений. API Anthropic проверяет эту подпись, когда блок отправляют обратно, и подписи совместимы между Claude API, Amazon Bedrock и Google Cloud (документация Anthropic). По ней API отличает блоки, которые действительно создал Claude.
Первый признак виден сразу: если при включённом мышлении подписи нет, это повод для вопросов к провайдеру. Смотреть надо через Anthropic-совместимый адрес: в OpenAI-совместимом формате этого поля обычно нет. Полная проверка — отправить блок с подписью обратно в официальный API в том же диалоге: блок с чужой или поддельной подписью API отклонит или отбросит. На этой проверке строит свой тест китайский открытый проект Veridrop: для Claude он прогоняет 12 проверок, в том числе подпись, счёт токенов и длинный контекст.
Ограничение одно: подпись подтверждает, что Claude ответил на этот запрос. Что следующий запрос уйдёт туда же, она не доказывает.
7. Сравнение с эталоном на своих задачах
Эта проверка ближе всего к тому, как модель будет работать у вас. Соберите 20–30 задач с проверяемым ответом: арифметика, код с тестами, извлечение данных в JSON. Прогоните их через проверяемого провайдера и через эталон при низкой температуре три раза в разные дни. Эталон — официальный API или провайдер, который раскрывает маршрут: на страницах моделей в каталоге видно, идёт ли предложение напрямую к разработчику, через Amazon Bedrock, Azure или OpenRouter.
Статистика тут работает. Тест из работы Стэнфордского университета находил изменённую модель по медиане в 77,4 % случаев, используя в среднем 10 ответов на запрос. Он же показал, что 11 из 31 коммерческого адреса с моделями Llama отдавали не то, что выпустила Meta (arXiv 2410.20247).
Задачи берите свои, а не из публичных бенчмарков. Посредник может узнавать известные тестовые вопросы и отправлять только их в настоящую модель (arXiv 2504.04715).
Чего эти проверки не докажут
Разовая проверка показывает, что было в момент проверки. Посредник может отдавать настоящую модель на часть запросов и дешёвую на остальные, и каждая проверка по отдельности это пропустит. Авторы работы из Беркли пишут прямо: программными средствами подмену надёжно не поймать, нужна аппаратная проверка вроде доверенной среды исполнения (TEE). Пока провайдер её не предлагает, остаётся проверять поведением.
Поэтому проверки стоит держать в виде скрипта и повторять: после смены цены, после жалоб на «поглупевшие» ответы и раз в месяц. А выбирать — среди тех, кто раскрывает маршрут к модели и юрлицо. Тип каждого провайдера (разработчик, облако, агрегатор или посредник) указан на его странице в списке провайдеров.
Цены и данные каталога — по состоянию на 2 октября 2026 года.
