教育数字化知识图谱
打开微信扫一扫
Xinference是最全面的企业级推理服务平台 Xinference 是针对生成式 AI 场景度身定制的能力全面的推理服务平台。功能覆盖算力、模型和高可用可观测的企业级能力。
vLLM是一个快速且易于使用的LLM推理和服务库。它支持分布式部署、容器化部署和OpenAI的数据格式等,并且内置了大模型服务,可以直接用命令启动。
硅基流动 SiliconCloud 推理服务,多模型 API 与私有化推理部署。
SGLang 是开源大模型推理引擎,以 RadixAttention+PagedAttention 技术在多轮对话与 Agent 场景实现极高吞吐与低首字时延,擅长共享前缀缓存与结构化/约束输出(JSON),适合高校高并发智能体服务与结构化生成场景,常与 vLLM 组成双引擎底座。
LMDeploy 是书生·InternLM 体系的开源大模型推理部署引擎,TurboMind 推理引擎与深度 INT4 量化对 Qwen/InternLM 等中文模型的低成本部署优化显著,对昇腾等国产 GPU 兼容性好,适合高校国产算力环境下的私有化推理部署。
Ollama 是本地优先的开源大模型运行工具,一条命令即可在消费级 GPU 与苹果芯片上运行 Llama、Qwen、DeepSeek 等开源模型,提供与 OpenAI 兼容的本地 API,广泛用于高校实验室与个人科研的轻量推理场景。