OpenAI, Anthropic, Google — у каждого есть API. Все берут деньги за токены. Если не следить за расходами с первого дня, счёт за месяц может неприятно удивить.
Мы через это прошли. Вот что помогло.
Логируйте каждый запрос
Это первое и главное. Заводите таблицу ai_logs с полями: модель, токены входа, токены выхода, промпт, ответ, время. Без этого вы слепые.
Когда у нас появилось логирование, выяснилось, что 30% токенов уходило на один и тот же системный промпт, который дублировался в каждом запросе. Вынесли его в кеш — сразу сэкономили.
Выбирайте модель под задачу
GPT-4o для простого FAQ — это как ехать на такси бизнес-класса за хлебом. gpt-4o-mini справляется с большинством задач классификации, извлечения данных, генерации коротких текстов и стоит в 15–20 раз дешевле.
Правило такое: начинайте с mini, переходите на старшую модель только если качество не устраивает.
Ограничивайте max_tokens
Всегда ставьте лимит токенов на ответ. Без него модель может написать эссе там, где нужно два слова. Для чат-ассистента на сайте нам хватает 800–1000 токенов.
Кешируйте повторяющиеся запросы
Если пользователи часто спрашивают одно и то же — кешируйте ответы в базе. Хешируете промпт, смотрите в кеш, при промахе — идёте в API. Простая оптимизация, которая на реальных проектах давала 40–60% экономии.
Используйте прокси-провайдеров
Для российских проектов прямой доступ к OpenAI усложнён. Мы используем proxyapi.ru — он полностью совместим с OpenAI SDK, цены сопоставимые, оплата рублями.