LLMPodLLMPod
私有化部署 · 多集群 GPU 推理

私有化 LLM 推理的基础设施

把自建 GPU 集群变成可调用、可计费、可容灾的推理 API。集群编排、模型部署、路由网关、多租户计权,开箱即用。

$ curl -fsSL get.llmpod.io | sh
24 nodes·192 GPUs·99.97% uptime
在线繁忙维护离线推理链路
prod-cn-1
集群 · 3 节点
node-cn-1a
24 GPU · 在线
node-cn-1b
24 GPU · 繁忙
node-cn-2a
16 GPU · 维护
A100 #0
#0 · 80GB
显存73.2/80
利用率47%
A100 #1
#1 · 80GB
显存58.7/80
利用率62%
A100 #2
#2 · 80GB
显存80.0/80
利用率91%
A100 #3
#3 · 80GB
显存41.5/80
利用率33%
A100 #4
#4 · 维护中draining · 迁移任务
H800 #0
#0 · 141GB
显存112/141
利用率58%
qwen2.5-72b
运行中tp=8 · 8×A100vllm:v0.6.3
llama3.1-8b
扩容中tp=2 · 2×A100vllm:v0.6.3
api.llmpod.io
2.4k req/minp99 · 214ms
拖拽平移 · 滚轮缩放
100%
LIVE · prod-cn-1

一体化的推理平台,不是拼装

从 GPU 节点到对外推理 API,一条链路打通。不用再自己粘 Prometheus、vLLM、网关和计费。

Cluster

集群编排

多集群拓扑可视化,节点引导脚本秒级接入。实时 GPU 指标、显存利用率、推理链路一目了然。

192 GPU · 24 节点 · 6 集群
Deploy

模型部署

预检 → 部署 → 日志 → 扩缩容,全生命周期。

Gateway

路由网关

端点定价、failover、权重优先级。

Billing

计费与日志

API Key 预算上限、调用日志、多租户 RBAC。按 token 计费,按租户隔离,调用可追溯。

按 token 计费 · 多租户隔离 · 调用可追溯
How it works

五步从 GPU 到推理 API

  1. 01

    声明集群

    一行命令引导 GPU 节点接入,拓扑自动注册。

  2. 02

    上传模型

    本地或远程模型源,切片上传带断点续传。

  3. 03

    部署预检

    推荐配置 + 校验 + 预览拓扑,防传几十 GB 后才发现用不了。

  4. 04

    启动推理

    vLLM / TGI 引擎,张量并行,健康检查就绪。

  5. 05

    发布路由

    绑定端点、定价、failover,对外提供推理 API。

定价

从自托管开源到私有化企业,按需选择。

查看完整定价
开源自托管
免费
  • 全部核心能力
  • 社区支持
  • 单租户
  • 不限 GPU 节点
推荐
团队云托管
按量
  • 多租户 RBAC
  • 优先支持
  • SLA 99.9%
  • 按 token 计费
  • 调用日志分析
企业私有化
联系
  • 定制集成
  • 专属运维
  • SLA 99.99%
  • 审计日志
  • 私有化部署

准备好在自己的 GPU 上跑推理了吗

一行命令接入节点,几分钟内部署模型,立刻对外提供推理 API。