模型部署
模型从文件到推理服务的完整生命周期:上传与断点续传、部署前预检、引擎参数选择、运行日志与扩缩容。
本节内容
01
模型上传
本地与远程模型源,大文件切片上传与断点续传。
02
部署预检
显存与算力校验、推荐配置生成、拓扑预览,避免传完几十 GB 才发现跑不起来。
03
推理引擎与并行策略
vLLM / TGI 引擎选择,张量并行与数据并行的适用场景。
04
日志与扩缩容
实例运行日志排查,按负载扩容与缩容副本。
模型从文件到推理服务的完整生命周期:上传与断点续传、部署前预检、引擎参数选择、运行日志与扩缩容。
本地与远程模型源,大文件切片上传与断点续传。
显存与算力校验、推荐配置生成、拓扑预览,避免传完几十 GB 才发现跑不起来。
vLLM / TGI 引擎选择,张量并行与数据并行的适用场景。
实例运行日志排查,按负载扩容与缩容副本。