LLMFinderнейросети для России

Как проверить, что агрегатор отдаёт настоящий Claude или GPT: 7 проверок, которые не обойти вопросом «кто ты?»

Модель называет себя так, как ей написали в системном промпте, поэтому вопрос «кто ты?» подмену не ловит. Ловят её цена, длина контекста, счёт токенов, вызов инструментов, скорость ответа и сравнение с эталоном на ваших задачах. Ни одна проверка не даёт гарантии, но вместе они отсекают грубую подмену.

Две одинаковые на вид шестерёнки под лупой, рядом штангенциркуль и линейка

Модель отвечает на «кто ты?» тем, что ей написали в системном промпте. В исследовании Калифорнийского университета в Беркли модели, которым подменили системный промпт, правильно называли себя почти в 0 % случаев (arXiv 2504.04715). Посредник, который подменяет модель, этот промпт и пишет.

Проверять приходится поведением и учётом. Ниже семь таких проверок.

Что подсовывают вместо заявленной модели

Исследователи CISPA проверили 24 адреса у трёх посредников, которыми пользовались авторы научных статей. В 45,83 % случаев «отпечаток» модели не совпал с заявленным (arXiv 2603.01919). В работе описаны три вида подмены:

  • Другая модель. Запросы к GPT-5 по отпечатку оказались ближе всего к небольшой открытой GLM-4-9B.
  • Модель без рассуждений вместо модели с рассуждениями. Вместо DeepSeek-Reasoner отвечал DeepSeek-Chat, и точность на олимпиадных задачах заметно падала.
  • Та же модель, но урезанная. Gemini 2.5 Flash проходила проверку отпечатка, но на медицинских тестах MedQA давала около 37 % правильных ответов против 83,82 % у официального API. Авторы предполагают обрезанный контекст, изменённые параметры или скрытую обработку промпта.

Сжатая версия (FP8, FP4) — это про открытые модели: DeepSeek, Qwen, Kimi, GLM. Веса Claude и GPT закрыты, сжать их посредник не может. Сжатие само по себе не обман, если провайдер о нём пишет. Если не пишет, по ответам его не поймать: классификаторы отличали сжатые до FP8 и INT8 модели от исходных примерно в 50 % случаев, то есть не лучше подброшенной монеты (arXiv 2504.04715). В каталоге LLMFinder сжатые версии помечены, а фильтр «Без сжатых версий» убирает их из сравнения.

1. Цена

Официальная цена Claude Sonnet 5.5 — $2 за миллион входных токенов, это 166,49 ₽ по курсу ЦБ на 2 октября 2026 года. У провайдеров из каталога вход стоит от 166,49 до 600 ₽ (страница модели).

Если закрытая модель стоит дешевле 70 % официальной и провайдер не объясняет скидку, каталог помечает предложение «ниже официальной» и не считает его самой низкой ценой. На 2 октября 2026 года такая пометка стоит у 6 предложений из 1070. Честных причин для такой скидки две: отложенная обработка (batch, flex) и кэширование промптов. Подробнее о них в статье «Почему Claude и GPT продают в 10 раз дешевле официальной цены».

Обратное неверно: высокая цена честность не доказывает. В исследовании CISPA соотношение цены посредника к официальной никак не предсказывало, насколько хуже окажутся ответы.

2. Длина контекста

У Claude Sonnet 5.5 контекст — миллион токенов. Урезанный контекст экономит посреднику деньги: длинный запрос обрезается, а модель отвечает по тому, что осталось. Если провайдер сам заявляет меньший контекст, проверяйте его цифру.

Проверка: возьмите длинный документ, вставьте в самое начало проверочный факт, например «код склада — 4471», и в конце спросите про него. Начните со 100 тысяч токенов и дойдите до 300 тысяч. Настоящая модель найдёт факт, урезанная ответит наугад или вернёт ошибку о длине запроса. Прогон на 300 тысячах входных токенов Claude Sonnet 5.5 стоит от 50 до 180 ₽ в зависимости от провайдера (цены на 2 октября 2026 года).

3. Счёт токенов

Посредник сам сообщает, сколько токенов вы потратили, и по этому числу списывает деньги. Проверить его можно.

Для GPT счётчик открыт: библиотека OpenAI tiktoken для GPT-4o, GPT-4.1 и семейства GPT-5 использует кодировку o200k_base. Посчитайте токены своего запроса локально и сравните с полем usage.prompt_tokens в ответе. Расхождение в несколько токенов нормально: служебная разметка сообщений тоже считается. Расхождение на десятки процентов — повод разбираться.

Для Claude у Anthropic есть бесплатный метод count_tokens, но он требует ключа и даёт оценку, а не точное число. Практичнее отправить один и тот же текст нескольким провайдерам и сравнить input_tokens: числа должны почти совпасть.

Стимул завышать счёт есть. Исследователи из Института Макса Планка показали, что при оплате за токен провайдеру выгодно завышать их число, а пользователь не может это доказать (arXiv 2505.21627). В работе CISPA число токенов у части посредников действительно расходилось с официальным API.

4. Вызов инструментов

Ошибки в вызове функций легко посчитать: модель зовёт инструмент не там, где официальный API, или присылает JSON с аргументами, который не проходит схему. Для агентов вроде Claude Code такие ошибки ломают работу.

Так сторонних провайдеров своей модели проверяет Moonshot, разработчик Kimi. Её открытый K2 Vendor Verifier прогоняет у каждого провайдера одни и те же запросы и считает две вещи: вызвала ли модель инструмент там же, где официальный API, и проходит ли JSON проверку по схеме. У официального API Kimi K2 0905 по схеме проходит 100 % вызовов, у некоторых сторонних площадок — около 72 %.

Для Claude и GPT можно сделать то же вручную: 20–30 запросов с описанием двух-трёх инструментов, ответы эталона и проверяемого провайдера сравнить по тем же двум признакам.

5. Скорость и поток

Замерьте время до первого токена и скорость генерации в токенах в секунду, а потом повторите в другой день. Скорость зависит и от нагрузки, поэтому смотрите на разброс, а не на одно число. Если она прыгает в разы, запросы могут уходить в разные модели.

Исследователи CISPA предлагают порог: провести не меньше трёх сессий на одном наборе задач и насторожиться, если разброс точности больше 5 процентных пунктов или коэффициент вариации задержки больше 0,15.

6. Подпись рассуждений у Claude

Когда у Claude включено мышление (thinking), каждый блок рассуждений приходит с полем signature — зашифрованной копией полных рассуждений. API Anthropic проверяет эту подпись, когда блок отправляют обратно, и подписи совместимы между Claude API, Amazon Bedrock и Google Cloud (документация Anthropic). По ней API отличает блоки, которые действительно создал Claude.

Первый признак виден сразу: если при включённом мышлении подписи нет, это повод для вопросов к провайдеру. Смотреть надо через Anthropic-совместимый адрес: в OpenAI-совместимом формате этого поля обычно нет. Полная проверка — отправить блок с подписью обратно в официальный API в том же диалоге: блок с чужой или поддельной подписью API отклонит или отбросит. На этой проверке строит свой тест китайский открытый проект Veridrop: для Claude он прогоняет 12 проверок, в том числе подпись, счёт токенов и длинный контекст.

Ограничение одно: подпись подтверждает, что Claude ответил на этот запрос. Что следующий запрос уйдёт туда же, она не доказывает.

7. Сравнение с эталоном на своих задачах

Эта проверка ближе всего к тому, как модель будет работать у вас. Соберите 20–30 задач с проверяемым ответом: арифметика, код с тестами, извлечение данных в JSON. Прогоните их через проверяемого провайдера и через эталон при низкой температуре три раза в разные дни. Эталон — официальный API или провайдер, который раскрывает маршрут: на страницах моделей в каталоге видно, идёт ли предложение напрямую к разработчику, через Amazon Bedrock, Azure или OpenRouter.

Статистика тут работает. Тест из работы Стэнфордского университета находил изменённую модель по медиане в 77,4 % случаев, используя в среднем 10 ответов на запрос. Он же показал, что 11 из 31 коммерческого адреса с моделями Llama отдавали не то, что выпустила Meta (arXiv 2410.20247).

Задачи берите свои, а не из публичных бенчмарков. Посредник может узнавать известные тестовые вопросы и отправлять только их в настоящую модель (arXiv 2504.04715).

Чего эти проверки не докажут

Разовая проверка показывает, что было в момент проверки. Посредник может отдавать настоящую модель на часть запросов и дешёвую на остальные, и каждая проверка по отдельности это пропустит. Авторы работы из Беркли пишут прямо: программными средствами подмену надёжно не поймать, нужна аппаратная проверка вроде доверенной среды исполнения (TEE). Пока провайдер её не предлагает, остаётся проверять поведением.

Поэтому проверки стоит держать в виде скрипта и повторять: после смены цены, после жалоб на «поглупевшие» ответы и раз в месяц. А выбирать — среди тех, кто раскрывает маршрут к модели и юрлицо. Тип каждого провайдера (разработчик, облако, агрегатор или посредник) указан на его странице в списке провайдеров.

Цены и данные каталога — по состоянию на 2 октября 2026 года.

Частые вопросы

Можно ли просто спросить модель, кто она?

Нельзя. Модель повторяет то, что написано в системном промпте. В исследовании Калифорнийского университета в Беркли модели с подменённым системным промптом правильно называли себя почти в 0 % случаев.

Если цена равна официальной или выше, подмены нет?

Нет. Исследователи CISPA не нашли связи между ценой посредника и тем, насколько его ответы хуже официальных. Высокая цена говорит только о наценке.

Можно ли подсунуть сжатую версию Claude или GPT?

Нет: веса Claude и GPT закрыты, сжать их посредник не может. Вместо них можно отдать другую модель. Сжатые версии FP8 и FP4 бывают у открытых моделей — DeepSeek, Qwen, Kimi, GLM.

Читайте также