Урок 1

Гид по выбору модели

Выбор правильной модели

Проблема: Доступны десятки LLM — GPT-5, Claude, o3, Gemini, Llama, DeepSeek и другие. Плюс reasoning-модели, которые думают перед ответом. Как выбрать правильную модель для конкретного случая использования?

Решение: Выбирай правильный инструмент под задачу

Выбор модели — это инженерное решение, сопоставляющее твои требования — скорость, стоимость, точность, длину контекста и модальность — с подходящей моделью. Единственной «лучшей» LLM не существует: модель, возглавляющая рейтинг, может быть избыточной для маршрутизации тикетов поддержки и при этом слабой для доказательства математической теоремы. Задача — найти самую дешёвую и быструю модель, которая перешагивает планку качества, реально нужную твоей задаче. Это как выбор транспорта: спорткар, грузовик и велосипед «лучшие» каждый только для своей поездки.

Как оценивать модель

Отталкивайся от задачи, а не от хайпа. Публичные бенчмарки (benchmarks) вроде MMLU или HumanEval — грубый фильтр для составления короткого списка кандидатов, но они почти не предсказывают качество на твоих данных. Поэтому собери небольшой набор для оценки (eval) из 50–100 реальных примеров и прогони на нём каждого кандидата. Дальше взвесь три операционные оси: задержку (latency) — время до первого токена и до полного ответа, стоимость — цену за миллион входных и выходных токенов (они различаются), и нужное тебе окно контекста (context window). Важны и возможности: лишь часть моделей хорошо умеет нативный вызов инструментов, зрение или длинный контекст. Для приватности и комплаенса модели с открытыми весами для собственного хостинга (Llama, Mistral) меняют удобство на контроль, а квантизация (quantization) ужимает их под твоё железо ценой небольшой потери качества.

Компромиссы, ловушки и разбор примера

Главная ловушка — переплата: флагманские цены за задачи, с которыми справится маленькая модель. Обратная крайность — недооценить по-настоящему сложную задачу на рассуждения и выдавать неверные ответы. Сильный приём — роутинг моделей: дешёвый классификатор отправляет лёгкие запросы на маленькую модель и эскалирует на флагман только сложные. Разбор примера: бот поддержки получает 10 000 тикетов в день. Отправка их всех на флагманскую модель по условной цене $5 за миллион выходных токенов может стоить сотни долларов в день. Вместо этого направь ~80% простых FAQ-тикетов на маленькую модель (Haiku / GPT-4o Mini) примерно за десятую часть цены, а на флагман эскалируй лишь ~20% неоднозначных или многошаговых случаев. На репрезентативном eval это обычно срезает суммарные расходы на 60–70%, сохраняя качество ответов в пределах пары процентов, — потому что маленькая модель и так была достаточно хороша для лёгкого большинства.

Представьте это как выбор автомобиля для разных задач:

  • 1. Задержка < 500мс И качество критично: Используйте GPT-4o или Claude Sonnet — лучший баланс скорости и интеллекта
  • 2. Стоимость < $0.01/запрос И простая задача: Используйте GPT-4o Mini или Claude Haiku — в 10-20 раз дешевле, отлично для классификации, извлечения, FAQ
  • 3. Контекст > 100K токенов: Используйте Claude (200K) или Gemini (1M+) — другие модели требуют разбиения документов
  • 4. Сложная математика / логика / рассуждения: Используйте reasoning-модели (o3, o4-mini) — они используют thinking tokens для пошаговых рассуждений, но стоят дороже из-за скрытых токенов
  • 5. Нужен on-premise / приватность данных: Используйте Llama или Mistral — модели с открытыми весами для собственного хостинга
  • 6. Всегда: тестируйте на ВАШИХ данных: Прогоните 50-100 реальных примеров через каждую модель-кандидат перед выбором — бенчмарки врут, ваши оценки — нет

Ключевые критерии выбора

  • Качество: Результаты бенчмарков (MMLU, HumanEval) менее важны, чем оценка на ВАШИХ данных — всегда тестируйте на реальных примерах из вашей области
  • Роутинг моделей: Используйте лёгкий классификатор для маршрутизации простых задач (FAQ, извлечение) на дешёвые модели, а сложных (рассуждения, код) — на флагманские. Экономия 60-80% при минимальной потере качества
  • Стоимость и задержка: Флагманские модели в 10-30 раз дороже и в 2-5 раз медленнее — обосновывайте апгрейд измеримой разницей качества на ваших оценках
  • Окно контекста: Нужно 100K+ токенов? Только Claude (200K) и Gemini (1M+) поддерживают нативно — для остальных нужны стратегии разбиения

Интересный факт: A/B-тестирование роутинга моделей в продакшене показало: отправка 80% тикетов поддержки на Haiku сэкономила 85% затрат при падении качества всего на 2%. Оставшиеся 20% сложных кейсов шли на Sonnet — общее снижение затрат 70% при почти идентичной удовлетворённости пользователей.

Попробуйте сами!

Используй интерактивное сравнение ниже, чтобы изучить разные модели и их компромиссы для различных случаев использования.

Сравнение моделей

Выберите ваш use case:

Сортировка:
МодельКонтекстЦена (вход)VisionToolsКачествоЛучше для
GPT-5
OpenAI
400K$1.25/1MТоп
General purposeAgents
Claude Opus 4.5
Anthropic
200K$15.00/1MТоп
ResearchComplex analysis
Claude Sonnet 4
Anthropic
200K$3.00/1MТоп
CodingAnalysis
o3
OpenAI
200K$2.00/1MТоп
Complex reasoningMath
GPT-4o
OpenAI
128K$2.50/1MВысокое
ChatVision
Gemini 2.5 Pro
Google
1M$1.25/1MВысокое
Long documentsReasoning
DeepSeek V3OSS
DeepSeek
128K$0.27/1MВысокое
Budget projectsCoding
Qwen 2.5 72BOSS
Alibaba
128KSelf-hostedВысокое
Asian languagesSelf-hosted
Mistral Large 2
Mistral
128K$2.00/1MВысокое
EU complianceCost-effective
Llama 3.3 70BOSS
Meta
128KSelf-hostedВысокое
Privacy-sensitiveFine-tuning
o4-mini
OpenAI
200K$1.10/1MВысокое
Budget reasoningMath
Gemini 2.5 Flash
Google
1M$0.30/1MСреднее
High volumeLong documents
GPT-4o mini
OpenAI
128K$0.15/1MСреднее
High volumeSimple tasks
Claude 3.5 Haiku
Anthropic
200K$0.80/1MСреднее
ClassificationSimple tasks

Быстрый выбор

  • Нужен лучший: Claude Opus 4.5 / GPT-5
  • Сложные рассуждения: o3 / o4-mini
  • Лучший для кода: Claude Sonnet 4
  • Экономия: DeepSeek V3 / GPT-4o mini / Gemini 2.5 Flash
  • Длинные документы: Gemini 2.5 Pro (1M tokens)
  • Приватность: Llama 3.3 / Qwen 2.5 (self-hosted)

Частые вопросы

Как выбрать LLM-модель под свою задачу?

Отталкивайся от задачи, а не от рейтингов. Собери eval-набор из 50–100 реальных примеров из своей области и прогони через каждого кандидата. Затем взвесь стоимость (цена за миллион входных и выходных токенов), задержку (latency) и нужное окно контекста. Выбирай самую дешёвую и быструю модель, которая перешагивает нужную тебе планку качества, — а не максимально мощную.

Чем флагманские модели отличаются от лёгких и когда переплата оправдана?

Флагманские модели (например, GPT-5, Claude Sonnet, o3) обычно в 10–30 раз дороже и в 2–5 раз медленнее лёгких (Haiku, GPT-4o Mini). Переплата оправдана только если на твоих eval-данных видна измеримая разница в качестве — например, на сложных рассуждениях, математике или коде. Для классификации, извлечения данных и FAQ лёгкая модель чаще всего справляется так же, но в разы дешевле.

Что такое роутинг моделей и сколько он экономит?

Роутинг моделей — это когда дешёвый классификатор сам решает, куда отправить запрос: простые задачи (FAQ, извлечение) уходят на маленькую модель, а сложные (рассуждения, многошаговые кейсы) эскалируются на флагман. Если ~80% запросов простые, такая схема обычно снижает суммарные расходы на 60–70% при падении качества в пределах пары процентов, потому что маленькая модель и так достаточно хороша для лёгкого большинства.

Можно ли доверять бенчмаркам вроде MMLU и HumanEval при выборе модели?

Бенчмарки — это лишь грубый фильтр для составления короткого списка кандидатов, они почти не предсказывают качество на твоих данных. Модели бывают «натренированы под тест», а твоя задача отличается от бенчмарка по домену, формату и языку. Поэтому окончательное решение всегда принимай по собственному eval-набору из реальных примеров: бенчмарки врут, твои оценки — нет.

Попробуй сам

Интерактивное демо этой техники

Сравнение техник
Демо режим
Предзаписанные ответы
ЗадачаНачинающийАнализ

Выбрать подходящую модель для задачи категоризации обращений в поддержку

Без техники
Без техники
Промпт
Классифицируй тикет в поддержку: "Не могу войти в аккаунт, забыл пароль". Категории: billing, auth, bug, feature_request.
Ответ

Данный запрос относится к категории "auth" (аутентификация). Пользователь испытывает трудности со входом в систему из-за утраченного пароля. Это типичная проблема аутентификации, которая решается через механизм сброса пароля. Рекомендую направить пользователю ссылку на восстановление пароля и проверить, не заблокирован ли аккаунт.

Токены:45/120
Время:2800ms
Качество:
С Выбор модели
С техникой
Промпт
Классифицируй тикет. Ответь ОДНИМ СЛОВОМ из списка: billing, auth, bug, feature_request. Тикет: "Не могу войти в аккаунт, забыл пароль"
Ответ

auth

👁️Для простой классификации не нужен GPT-4 — достаточно лёгкой модели (GPT-4o-mini, Haiku)
🧠Промпт сокращён: убрано многословие, ответ ограничен одним словом → меньше токенов на выходе
🔢Стоимость: GPT-4 ~$0.03/запрос vs GPT-4o-mini ~$0.0003/запрос — разница в 100 раз
Правило: подбирай модель под сложность задачи, не используй пушку против воробьёв
Токены:35/2
Время:180ms
Качество:
Почему это работает

Не каждая задача требует самой мощной модели. Для простой классификации лёгкая модель даёт тот же результат в 15 раз быстрее и в 100 раз дешевле.

1 / 2

Квиз по уроку

1 из 3

1.Какие ключевые критерии при выборе между LLM-моделями для продакшн-приложения?

Практика

Создайте бесплатный аккаунт для решения челленджей

3 челленджей с AI-проверкой для этого урока

Связанные уроки:BenchmarksCost Optimization

Этот урок — часть структурированного курса по LLM.

Мой путь обучения