1. 首页 >  币资讯

Easy and Efficient Transformer(网易超大模型线上推理引擎)

网易开源的针对tran**ormer-based模型的推理加速框架,支持在中低端Ampere架构上单卡高性能推理百亿级模型。

项目背景

基于变压器的大规模模型在许多领域的各种任务中被证明有效。然而,将其应用于工业生产需要付出大量的努力来**推理成本。为了填补这一空白,我们提出了一种可扩展的推理解决方案:Easy and Efficient Tran**ormer (EET)。EET是一个包含算法和实现层面的一系列Tran**ormer推理优化的系统。通过优化Tran**ormer的计算和数据流程,EET能够显著**推理成本,提高模型的效率和性能。我们的实验结果表明,EET在不损失模型精度的情况下,能够显著提高推理速度和资源利用率,为工业生产中的大规模模型应用提供了一种简单有效的解决方案。

首先,我们为长输入和大隐藏尺寸设计了高度优化的内核。

此外,我们还提出了一种灵活的CUDA内存管理器,以**大型模型部署时的内存占用。与**进的Tran**ormer推理库(Faster Tran**ormer v4.0)相比,EET在A100 GPU上能够实现平均1.40-4.20倍的解码层加速。

论文地址

https://arxiv.org/abs/2104.12470

Git**地址

https://git**.com/NetEase-FuXi/EET