跳转到内容
xLLM
开始使用
硬件
用户指南
实践指南
开发者指南
CLI 参考
搜索
Ctrl
K
取消
GitHub
中
EN
中
主页
开始使用
快速开始
启动xllm
多机部署
在线服务
离线推理
模型支持列表
硬件
硬件平台
NVIDIA GPU
昇腾 NPU
寒武纪 MLU
海光 DCU
沐曦 MACA
摩尔线程 MUSA
用户指南
高级功能
异步调度
多流并行
ChunkedPrefill调度器
Zero Evict调度器
PD分离
Prefix Cache 优化
全局多级KV Cache
多模态支持
EP并行
MoE负载均衡(EPLB)
MTP投机推理
Graph Mode
FlashComm
xLLM Service
实践指南
自回归模型
Qwen
Qwen3.5
Qwen3
Qwen3-Next
Qwen3-VL
Qwen2.5-VL
DeepSeek
DeepSeek-V4
DeepSeek-V3.2
DeepSeek-V3.1
DeepSeek-V3
DeepSeek-R1
GLM
GLM-5.2
GLM-5.1
GLM-5
GLM-4.7
GLM-4.7-Flash
GLM-4.6
GLM-4.6V
GLM-4.5
GLM-4.5V
Kimi
Kimi2
Kimi-K2.5 / Kimi-K2.6
MinMax
MiniMax-M2.7
扩散模型
Flux
Flux
Flux2
Wan
Wan2.1
Qwen-Image
Qwen-Image
开发者指南
开发
代码结构
xLLM Ascend TileLang Kernel 开发指南
在线性能采集 (Online Profiling)
AI Coding 工作流
自动调优配置 (Auto Config) 开发指南
设计文档
Graph Mode 设计文档
生成式推荐设计文档
C++ Serving Framework + Python Model Execution 架构决策
CLI 参考
GitHub
选择语言
EN
中
硬件平台
Copy page
xLLM 支持多种加速器后端,用于大模型推理部署。本章节汇总不同硬件平台的环境准备、运行时设备选择、服务启动和模型支持入口。
平台指南
Section titled “平台指南”
NVIDIA GPU
- CUDA 后端环境和启动入口。
昇腾 NPU
- 昇腾 NPU 环境、运行时变量和 HCCL 启动注意事项。
寒武纪 MLU
- MLU 后端环境和启动入口。
海光 DCU
- 海光 DCU 后端环境和启动入口。
沐曦 MACA
- 沐曦 MACA 后端环境和启动入口。
摩尔线程 MUSA
- 摩尔线程 MUSA GPU 镜像启动入口。
通用流程
Section titled “通用流程”
根据各平台指南中的显式命令准备对应平台的容器镜像。
在容器内编译 xLLM,或直接使用已经包含
xllm
的 release 镜像。
按
启动 xllm
中对应平台的设备后端启动服务。
在
模型支持列表
中确认模型和模态覆盖情况。