时间:2026-08-29 15:23 | 来源:墨客学术 | 作者:墨客学术 | 点击:次
获得出色的模型性能
借助 NVIDIA 和社区的加速引擎 (包括 TensorRT、TensorRT-LLM、vLLM、SGLang 等) 提高 AI 应用程序的性能和效率,这些引擎针对特定 NVIDIA GPU 系统上的低延迟、高吞吐量推理进行了预构建和优化。
随时随地运行 AI 模型
借助可部署在任何位置 (工作站、数据中心或云) 的 NVIDIA GPU 上的预构建微服务,保持应用程序和数据的安全性和控制力。下载用于自托管部署的 NIM 推理微服务,或利用 Hugging Face 上的专用端点在您首选的云中启动实例。
在数千种 AI 模型与定制方案中自由选择
部署 vLLM、SGLang 或 TensorRT-LLM 支持的各种 LLM,包括社区微调模型和基于数据微调的模型。
更大限度地提高可操作性和规模
获取用于控制面板的详细可观察性指标,并访问 Helm 图表和在 Kubernetes 上扩展 NIM 的指南。