SGLang
-
SGLang推理服务平台
SGLang 是开源大模型推理引擎,以 RadixAttention+PagedAttention 技术在多轮对话与 Agent 场景实现极高吞吐与低首字时延,擅长共享前缀缓存与结构化/约束输出(JSON),适合高校高并发智能体服务与结构化生成场景,常与 vLLM 组成双引擎底座。