获得出色的模型性能 借助 NVIDIA 和社区的加速引擎 (包括 TensorRT、TensorRT-LLM、vLLM、SGLang 等) 提高 AI 应用程序的性能和效率,并访问 Helm 图表和在 Kubernetes 上扩展 NIM 的指南。
保持应用程序和数据的安全性和控制力, 更大限度地提高可操作性和规模 获取用于控制面板的详细可观察性指标,包括社区微调模型和基于数据微调的模型。
,这些引擎针对特定 NVIDIA GPU 系统上的低延迟、高吞吐量推理进行了预构建和优化,下载用于自托管部署的 NIM 推理微服务,。
随时随地运行 AI 模型 借助可部署在任何位置 (工作站、数据中心或云) 的 NVIDIA GPU 上的预构建微服务, 在数千种 AI 模型与定制方案中自由选择 部署 vLLM、SGLang 或 TensorRT-LLM 支持的各种 LLM。
或利用 Hugging Face 上的专用端点在您首选的云中启动实例。
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。