NVIDIA Triton助力腾讯PCG加速在线推理-电子发烧友网

案例简介

本案例中通过NVIDIA T4 GPU，通过Ronda平台调用Triton以及TensorRT，整体提升开发和推理效能，帮助腾讯PCG的多个服务整体效能提升2倍，吞吐量最大提升6倍，同时降低了40%的延时。本案例主要应用到 NVIDIA T4 GPU、TensorRT和Triton。

本案例主要应用到 NVIDIA T4 GPU、TensorRT和Triton。

客户简介及应用背景

腾讯平台与内容事业群（简称腾讯PCG）负责公司互联网平台和内容文化生态融合发展，整合QQ、QQ空间等社交平台，和应用宝、浏览器等流量平台，以及新闻资讯、视频、体育、直播、动漫、影业等内容业务，推动IP跨平台、多形态发展，为更多用户创造海量的优质数字内容体验。

腾讯PCG机器学习平台部旨在构建和持续优化符合PCG技术中台战略的机器学习平台和系统，提升PCG机器学习技术应用效率和价值。建设业务领先的模型训练系统和算法框架；提供涵盖数据标注、模型训练、评测、上线的全流程平台服务，实现高效率迭代；在内容理解和处理领域，输出业界领先的元能力和智能策略库。机器学习平台部正服务于PCG所有业务产品。

客户挑战

业务繁多，场景复杂

业务开发语言包括C++/Python

模型格式繁多，包括ONNX、Pytorch、TensorFlow、TensorRT等

模型预处理涉及图片下载等网络io

多模型融合流程比教复杂，涉及循环调用

支持异构推理

模型推理结果异常时，难以方便地调试定位问题

需要与公司内现有协议/框架/平台进行融合

应用方案

基于以上挑战，腾讯PCG选择了采用NVIDIA 的Triton推理服务器，以解决新场景下模型推理引擎面临的挑战，在提升用户研效的同时，大幅降低了服务成本。

NVIDIA Triton 是一款开源软件，对于所有推理模式都可以简化模型在任一框架中以及任何 GPU 或 CPU 上的运行方式，从而在生产环境中使用 AI。Triton 支持多模型ensemble，以及 TensorFlow、PyTorch、ONNX 等多种深度学习模型框架，可以很好的支持多模型联合推理的场景，构建起视频、图片、语音、文本整个推理服务过程，大大降低多个模型服务的开发和维护成本。

基于C++ 的基础架构、Dynamic-batch、以及对 TensorRT 的支持，同时配合 T4 的 GPU，将整体推理服务的吞吐能力最大提升 6 倍，延迟最大降低 40%，既满足了业务的低延时需求，成本也降低了20%-66%。

通过将Triton编译为动态链接库，可以方便地链入公司内部框架，对接公司的平台治理体系。符合C语言规范的API也极大降低了用户的接入成本。

借助Python Backend和Custom Backend，用户可以自由选择使用C++/Python语言进行二次开发。

Triton的Tracing能力可以方便地捕捉执行过程中的数据流状态。结合Metrics 和 Perf Analysis等组件，可以快速定位开发调试，甚至是线上问题，对于开发和定位问题的效率有很大提升。

NVIDIA DALI 是 GPU 加速的数据增强和图像加载库。DALI Backend可以用于替换掉原来的图片解码、resize等操作。FIL Backend也可以替代Python XGBoost模型推理，进一步提升服务端推理性能。

方案效果及影响

借助NVIDIA Triton 推理框架，配合 DALI/FIL/Python 等Backend，以及 TensorRT，整体推理服务的吞吐能力最大提升 6 倍，延迟最大降低 40%。帮助腾讯PCG各业务场景中，以更低的成本构建了高性能的推理服务，同时更低的延迟降低了整条系统链路的响应时间，优化了用户体验。

审核编辑：郭婷

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表电子发烧友网立场。文章及其配图仅供工程师学习之用，如有内容侵权或者其他违规问题，请联系本站处理。举报投诉

NVIDIA

NVIDIA

+关注

关注
14

文章
4985

浏览量
103031
C++

C++

+关注

关注
22

文章
2108

浏览量
73639
python

python

+关注

关注
56

文章
4796

浏览量
84664

Triton编译器在机器学习中的应用

1. Triton编译器概述 Triton编译器是NVIDIA Triton推理服务平台的一部分，它负责将深度学习模型转换为优化的格式，以便

发表于 12-24 18:13 •316次阅读

Triton编译器功能介绍 Triton编译器使用教程

Triton 是一个开源的编译器前端，它支持多种编程语言，包括 C、C++、Fortran 和 Ada。Triton 旨在提供一个可扩展和可定制的编译器框架，允许开发者添加新的编程语言特性和优化技术

发表于 12-24 17:23 •305次阅读

NVIDIA助力Figure发布新一代对话式人形机器人

该初创公司展示了新型机器人，其使用 NVIDIA Isaac Sim 处理合成数据，并使用基于 NVIDIA 加速计算进行实时推理训练的生成式 AI 模型。

发表于 11-04 10:10 •259次阅读

FPGA和ASIC在大模型推理加速中的应用

随着现在AI的快速发展，使用FPGA和ASIC进行推理加速的研究也越来越多，从目前的市场来说，有些公司已经有了专门做推理的ASIC，像Groq的LPU，专门针对大语言模型的推理做了优化

发表于 10-29 14:12 •428次阅读

FPGA和ASIC在大模型<b class='flag-5'>推理</b><b class='flag-5'>加速</b>中的应用

NVIDIA助力丽蟾科技打造AI训练与推理加速解决方案

丽蟾科技通过 Leaper 资源管理平台集成 NVIDIA AI Enterprise，为企业和科研机构提供了一套高效、灵活的 AI 训练与推理加速解决方案。无论是在复杂的 AI 开发任务中，还是在高并发

发表于 10-27 10:03 •216次阅读

<b class='flag-5'>NVIDIA</b><b class='flag-5'>助力</b>丽蟾科技打造AI训练与<b class='flag-5'>推理</b><b class='flag-5'>加速</b>解决方案

NVIDIA与思科合作打造企业级生成式AI基础设施

由 NVIDIA 加速计算平台、NVIDIA AI Enterprise 软件和 NVIDIA NIM 推理微服务加持的思科 Nexus H

发表于 10-10 09:35 •347次阅读

NVIDIA助力提供多样、灵活的模型选择

在本案例中，Dify 以模型中立以及开源生态的优势，为广大 AI 创新者提供丰富的模型选择。其集成的 NVIDIAAPI Catalog、NVIDIA NIM和Triton 推理服务器产品，为

发表于 09-09 09:19 •468次阅读

英伟达推出全新NVIDIA AI Foundry服务和NVIDIA NIM推理微服务

NVIDIA 宣布推出全新 NVIDIA AI Foundry 服务和 NVIDIA NIM 推理微服务，与同样刚推出的 Llama 3.1 系列开源模型一起，为全球企业的生成式 AI

发表于 07-25 09:48 •705次阅读

LLM大模型推理加速的关键技术

LLM（大型语言模型）大模型推理加速是当前人工智能领域的一个研究热点，旨在提高模型在处理复杂任务时的效率和响应速度。以下是对LLM大模型推理加速关键技术的详细探讨，内容将涵盖模型压缩、

发表于 07-24 11:38 •885次阅读

NVIDIA加速计算和 AI助力数字银行揭穿金融欺诈骗局

Bunq 利用 NVIDIA AI 将其欺诈检测模型的训练速度提高近百倍。欧洲新型银行 Bunq 正在 NVIDIA 加速计算和 AI 的助力下，揭穿金融欺诈者的骗局。被称为“

发表于 06-27 17:41 •847次阅读

英特尔助力京东云用CPU加速AI推理，以大模型构建数智化供应链

发表于 05-27 11:50 •534次阅读

英特尔<b class='flag-5'>助力</b>京东云用CPU<b class='flag-5'>加速</b>AI<b class='flag-5'>推理</b>，以大模型构建数智化供应链

NVIDIA加速微软最新的Phi-3 Mini开源语言模型

NVIDIA 宣布使用 NVIDIA TensorRT-LLM 加速微软最新的 Phi-3 Mini 开源语言模型。TensorRT-LLM 是一个开源库，用于优化从 PC 到云端的 NVID

发表于 04-28 10:36 •559次阅读

利用NVIDIA组件提升GPU推理的吞吐

本实践中，唯品会 AI 平台与 NVIDIA 团队合作，结合 NVIDIA TensorRT 和 NVIDIA Merlin HierarchicalKV（HKV）将推理的稠密网络和热

发表于 04-20 09:39 •722次阅读

使用NVIDIA Triton推理服务器来加速AI预测

这家云计算巨头的计算机视觉和数据科学服务使用 NVIDIA Triton 推理服务器来加速 AI 预测。

发表于 02-29 14:04 •580次阅读

利用NVIDIA产品技术组合提升用户体验

本案例通过利用NVIDIA TensorRT-LLM加速指令识别深度学习模型，并借助NVIDIA Triton推理服务器在

发表于 01-17 09:30 •689次阅读

搜索历史

NVIDIA Triton助力腾讯PCG加速在线推理

评论