Большинство «ИИ-проектов» начинаются с модели, под которую ищут применение. Мы начинаем с задачи, данных и цифры, которую нужно сдвинуть, и собираем минимальную систему, которая надёжно её сдвигает. Потом передаём её вам.
Маршрутизация, извлечение и вопросы-ответы, это разные задачи. Каждая получает свою компактную модель, свои данные и свою метрику, вместо одной гигантской модели, которую просят делать всё примерно.
До начала обучения мы согласуем эталонный набор и целевое значение. Проект оценивается по этой цифре, письменно. Никаких демо на удобных примерах.
Веса, данные, пайплайн, контейнер. Никакой лицензии в нашу пользу, никакого API-ключа, который можно отозвать, никакого вендора, который может отключить вашу модель. Если мы завтра исчезнем, всё продолжит работать.
Два инженера садятся с вашим экспертом и точно формулируют задачу, «распределить каждое входящее письмо в одну из 14 очередей», «извлечь эти 12 полей из счёта поставщика», и что значит «правильно». Вместе собираем эталонный набор из нескольких сотен проверенных примеров. Это и есть договор.
Хорошие данные, большая часть работы. Мы собираем реальные входные данные из ваших систем (или генерируем реалистичные синтетические, если реальные нельзя передавать), чистим и дедуплицируем их и готовим тысячи размеченных примеров, сочетая экспертные правила, лучшие доступные ИИ-инструменты и ручную проверку. Если того требует политика, каждый шаг выполняется офлайн внутри вашей среды (см. Безопасность).
Обучаем компактную модель с открытыми весами (обычно 0,5-8 млрд параметров) только под вашу задачу, итерируем на эталонном наборе и жёстко ограничиваем формат ответа, строгий JSON, фиксированный набор меток, чтобы ваш код никогда не видел свободный текст. На узких задачах специализированная небольшая модель регулярно догоняет или обходит универсальные большие; отчёт по оценке покажет, где именно она стоит.
Поставка. Docker/OCI-образ с OpenAI-совместимым HTTP API, так что существующие интеграции работают без изменений. Запускается на обычном сервере, для большинства задач достаточно машины с обычным процессором; при очень больших объёмах ускоряет одна GPU-карта. Ничто в образе не «звонит домой». Устанавливаем вместе с вашей командой и передаём веса, датасет, пайплайн и инструменты проверки.
Реальный трафик всегда вскрывает случаи, которых не было в эталонном наборе. Примерно через месяц после запуска мы собираем ошибки и артефакты, которые дала эксплуатация, дообучаем, перепроверяем и переразворачиваем модель. Этот раунд входит в фиксированную стоимость. Дальше, опциональное сопровождение с мониторингом дрейфа и периодическим переобучением, либо ваша команда запускает пайплайн сама.
Всё передаётся. Отсутствие привязки к нам, и есть продукт.
Базовая модель с открытой лицензией + ваше обучение под задачу. Хранятся там, где скажете. Разворачиваются без нас.
OpenAI-совместимый эндпоинт /v1/chat/completions. Подставляется вместо API в существующий код.
Пересчитывайте метрики в любой момент. Сравнивайте будущие модели. Подтверждайте соответствие требованиям.
Датасет, конфигурация, сиды. Воспроизводимо силами вашей команды.
Типичные конфигурации, точный расчёт входит в проект.
| Сложность задачи | На чём работает | Для чего подходит |
|---|---|---|
| Простая | Любой сервер, только CPU | Классификация, маршрутизация, поиск ПДн, короткое извлечение |
| Средняя | Обычный сервер; при больших объёмах. GPU-карта среднего класса | Структурированное извлечение, связывание сущностей, короткие ответы |
| Сложная | Сервер с одной GPU-картой | Длинные документы, генерация SQL, многошаговое извлечение на большом потоке |
Железо подбираем в рамках проекта; большинство первых задач работает на сервере, который у клиента уже есть.
Тот же процесс, ваши данные, ваша метрика, одна фиксированная цена.