Инференс

Работа обученной модели «на выдачу» — генерация ответа на ваш запрос.

Инференс — этап, на котором готовая модель применяется к новым данным: получает промпт и выдаёт результат. В отличие от обучения, инференс происходит при каждом запросе и определяет скорость и стоимость эксплуатации AI-продукта. Оптимизация инференса (кэш, батчинг, выбор модели) — часть экономики любого агента.

Смежные термины

LLM (большая языковая модель)ТокенFine-tuning (дообучение)

BASEMIND строит на этом реальные продукты — AI-агентов, второй мозг и нейропродакшн.

Смотреть услуги →