LLMPodLLMPod
产品能力

一体化的推理平台,不是拼装

从 GPU 节点到对外推理 API,一条链路打通。不用再自己粘 Prometheus、vLLM、网关和计账。

cluster orchestration

集群编排

多集群拓扑可视化,节点引导脚本秒级接入。实时 GPU 指标、显存利用率、推理链路一目了然——哪个节点在跑什么模型、还剩多少显存,不用登机器查。

model deployment

模型部署

模型市场拉取,切片上传带断点续传。部署预检在传几十 GB 之前就帮你校验配置、预览拓扑——推荐张量并行度、预估显存占用、提示不兼容项。部署启停、滚动更新、全生命周期日志在同一个界面。

routing gateway

路由网关

端点定价、failover、权重优先级——把多个推理后端编成一组对外端点。

multi-tenant rbac

多租户 RBAC

平台域 + 租户域双层角色权限,粒度到单个集群和模型。

api key & billing

API Key 计费

预算上限、按 token 计费、调用日志全链路可追溯。

model distribution

模型分发

文件清单校验完整性,Range 续传下载到指定节点。

Inference engines

支持主流推理引擎

按集群硬件和模型类型选引擎,LLMPod 负责调度、容灾和计量。切换引擎不需要改业务侧调用代码。

vLLMTGISGLangTensorRT-LLMLMDeploy

准备好在自己的 GPU 上跑推理了吗

从集群接入到推理 API 上线,大多数团队在一个下午内完成。注册控制台即可创建第一个端点。