大模型推理模式解析:Fast模式与Batch处理的技术原理与成本权衡
2026-08-24 09:30:58
1. 项目概述:理解大模型推理的“快”与“贵” 最近在部署和优化大语言模型(llm)服务时,一个绕不开的话题就是推理模式的选择。大家可能都听说过“流式输出”(streaming)和“非流式输出”(non-streaming),但更底层的,其实是推理引擎在处理请求时采用的两种核心调度策略: prefill/decode 模式 和 batch 处理模式 。标题里提到的“fast 模式”,在很多高性能推理框架(如 vllm, tensorrt-llm, tgi)中,通常指的就是为了追求极致单请求响应速度而优化的模式,它本质上深度依赖 prefill/decode 的精细调度,并有意避开了 batch 处理。这种模式确实能让第一个 token 的延迟(time to first token, ttft)和后续 token 的吞吐(token per second, tps)看起来非常漂亮,但账单也会随之变得“漂亮”起来。这背后不是简单的“一分钱一分货”,而是一套严谨的“推理经济学”。