Развернуть собственную GPU-инфраструктуру для инференса современных LLM — задача не из дешёвых. A100/H100 кластеры требуют бюджета от миллионов долларов и команды MLOps-инженеров. Together AI снимает этот барьер: мы берём на себя интеграцию ваших сервисов с платформой. Подключаем OpenAI-совместимый API, настраиваем роутинг между моделями, оптимизируем latency p99 — и вы получаете готовый endpoint под свои задачи. За 5+ лет работы мы реализовали более 30 проектов по интеграции LLM в продакшен — оценим ваш проект в течение дня.
Кейс: для финтех-стартапа мы развернули RAG-систему на Together AI за 3 дня. До этого они платили за аренду выделенных GPU на AWS — Together снизил затраты в 5 раз, latency p99 не превышала 200 мс, точность ответов достигла 94%. Это не единичный пример: по данным документации платформы, её использование позволяет сократить расходы на инференс до 80%. По сравнению с арендой GPU у AWS, Together AI даёт экономию до 80% при сопоставимой производительности.
Какие проблемы решает Together AI?
Высокая стоимость GPU. Аренда собственных A100/H100 в облаках выливается в десятки тысяч долларов ежемесячно. Together AI использует общий пул GPU, что снижает стоимость инференса в 5–10 раз по сравнению с инстансами облаков. Сложность деплоя: выбор версии CUDA, оптимизация через vLLM или TensorRT-LLM — инженерные часы. Платформа берёт на себя все низкоуровневые оптимизации. Отсутствие гибкости: балансировка между качеством и скоростью — мы реализуем роутер, который автоматически переключает модель в зависимости от контекста.
Базовая интеграция
from openai import OpenAI, AsyncOpenAI # Together использует OpenAI SDK client = OpenAI( api_key="TOGETHER_API_KEY", base_url="https://api.together.xyz/v1", ) # Выбор модели MODELS = { "quality": "meta-llama/Meta-Llama-3.1-405B-Instruct-Turbo", "balanced": "meta-llama/Meta-Llama-3.1-70B-Instruct-Turbo", "fast": "meta-llama/Meta-Llama-3.1-8B-Instruct-Turbo", "code": "Qwen/Qwen2.5-Coder-32B-Instruct", "reasoning": "deepseek-ai/DeepSeek-R1-Distill-Llama-70B", } response = client.chat.completions.create( model=MODELS["balanced"], messages=[{"role": "user", "content": "Задача"}], temperature=0.1, max_tokens=2048, ) print(response.choices[0].message.content) Как работает роутинг моделей?
Роутер анализирует запрос: если задача требует глубоких рассуждений — направляет на DeepSeek-R1, если нужна скорость — на Llama 3.1 8B. Это снижает среднюю стоимость токена на 30–40% без потери качества. Под капотом используем динамический threshold по latency и confidence.
Подробнее о настройке роутинга
Мы настраиваем пороговые значения через A/B тестирование на репрезентативной выборке запросов. Затем роутер автоматически адаптируется под нагрузку, переключая модели в зависимости от текущей latency и требуемого качества.
Как происходит fine-tuning?
Fine-tuning открытых моделей под собственные данные позволяет улучшить точность и снизить галлюцинации. Together AI предоставляет инфраструктуру для LoRA и полного fine-tuning. Мы помогаем подготовить датасет, выбрать гиперпараметры и провести A/B тестирование. Пример запуска:
# Together позволяет fine-tune открытые модели на собственных данных import together together.api_key = "TOGETHER_API_KEY" # Загружаем датасет (JSONL формат: {"prompt": "...", "completion": "..."}) file_response = together.Files.upload(file="training_data.jsonl") file_id = file_response["id"] # Запускаем fine-tuning ft_response = together.Finetune.create( training_file=file_id, model="meta-llama/Meta-Llama-3.1-8B-Instruct-Reference", n_epochs=3, batch_size=16, learning_rate=1e-5, suffix="my-custom-model", ) ft_job_id = ft_response["id"] # Проверяем статус status = together.Finetune.retrieve(ft_job_id) print(status["status"]) # "running" | "completed" | "failed" Преимущества fine-tuning на Together AI
Платформа управляет всеми вычислительными ресурсами — не нужно думать о GPU. Доступны предобученные LoRA-веса, которые можно кастомизировать под свои данные. Мы помогаем с подбором гиперпараметров и оценкой метрик на валидационном датасете. Fine-tuning окупается за счёт повышения точности и снижения количества дорогих токенов.
Embeddings и RAG
Для Retrieval-Augmented Generation используем embeddings модели, например BAAI/bge-large-en-v1.5. Together AI поддерживает асинхронную генерацию embeddings, что важно при высоких нагрузках:
response = client.embeddings.create( model="BAAI/bge-large-en-v1.5", # Один из лучших для поиска input=["Первый текст", "Второй текст"], ) embeddings = [item.embedding for item in response.data] Сравнение моделей на Together AI
| Модель | Качество | Скорость (токен/с) | Ресурсоёмкость |
|---|---|---|---|
| Llama 3.1 405B | Excellent | ~50 | Требует H100 |
| Llama 3.1 70B | Very Good | ~150 | Средняя |
| Llama 3.1 8B | Good | ~400 | Низкая |
| Qwen2.5-Coder 32B | Code-specific | ~120 | Средняя |
| DeepSeek-R1 70B | Reasoning | ~100 | Средняя |
Как интегрировать Together AI за 3 шага?
- Получите API-ключ в панели управления Together AI.
- Замените base_url в вашем OpenAI-клиенте на
https://api.together.xyz/v1. - Настройте роутинг — мы подберём модели под ваши сценарии. Получите endpoint за 0.5 дня.
Получите консультацию по интеграции Together AI.
Сколько времени занимает интеграция?
Интеграция базового API занимает 0.5 дня: замена base_url и ключа. Полный проект с fine-tuning и RAG — от 5 рабочих дней. Стоимость рассчитывается индивидуально под объём трафика и сложность моделей. Закажите интеграцию — получите готовый endpoint за 1 день.
Процесс работы
| Этап | Длительность |
|---|---|
| Аналитика сценариев | 1–2 дня |
| Выбор и тестирование моделей | 2–3 дня |
| Интеграция API и роутинг | 1–2 дня |
| Fine-tuning и A/B тест | 3–5 дней |
| Деплой и оптимизация | 2–3 дня |
| Обучение команды | 1 день |
Что входит в работу
- Подключение Together AI к вашему проекту (0.5 дня)
- Fine-tuning pipeline с A/B тестированием (3–5 дней)
- Интеграция embeddings для RAG (1–2 дня)
- Оптимизация стоимости (настройка роутинга, кэширования, batch-обработки)
- Документация и обучение команды
- Поддержка после запуска (мониторинг, донастройка)
Свяжитесь с нами — оценим ваш проект и предложим оптимальное решение. Гарантируем снижение затрат на инференс в 2–5 раз по сравнению с арендой GPU. Дополнительно читайте про LLM — это основа, на которой строятся все современные AI-решения.







