相关文章推荐
瘦瘦的青蛙  ·  在使用Dask ...·  2 年前    · 
狂野的松树  ·  如何停止 try/except ...·  3 年前    · 

这家创企名为Habana Labs,年纪不足4岁,去年才刚刚从神秘的“隐身模式”中脱离出来,而就在短短9个月的时间,它先后推出AI推理处理器Goya和AI训练处理器Gaudi,并且均比NVIDIA的旗舰产品拥有更好的性能表现。

它的两款芯片究竟实力如何,能否打破云端AI芯片领域的现有格局?它们如何达到这样的性能表现?今日,Habana Labs首席商务官Eitan Medina详细介绍了Habana Labs两款AI处理器的强大性能,以及实现这些性能背后所做的一系列创新。

一、训练性能达V100的4倍,今年下半年出样品

先简单介绍下Habana Labs,这家公司创立于2016年,总部在以色列,在波兰有一个研发中心,在中美有两个销售中心。它的目标相当直接,要成为未来在AI芯片领域的行业领导者。

其团队来自知名的处理器、DSP、系统设计、网络设计公司。产品包括软件和硬件研发,若干款AI产品已经发布。

去年11月,这家公司完成由 英特尔 领投的7500万美元B轮融资,累计融资约1.2亿美元。

Habana Labs首款AI训练处理器在本周刚刚推出,将于2019年下半年面向特定客户提供样品。

Eitan Medina说,Gaudi主要有两大亮点:一是拥有比GPU更高的处理能力、更优的性能和功耗;二是通过内置RDMA以太网处理单元,提供过去的芯片无法实现的可扩展能力。

这张图展现了Gaudi的扩展能力,在ResNet-50训练中,同样约使用700个处理器,Gaudi的计算能力能达到V100的3.8倍。

Eitan Medina补充说,在不同规模的系统平台下,Gaudi的算力和功耗比均高于GPU。

因此,基于Gaudi处理器的训练性能可实现从单一设备扩展至由数百个处理器搭建的大型系统的线性扩展。

2、集成标准以太网,实现速度和端口数无限扩展

在AI训练中,可扩展能力主要与网络相关。

Gaudi处理器片上集成了10个100GbE以太网端口,每个以太网端口均支持RDMA over Converged Ethernet (RoCE v2) 功能,从而让AI系统、计算系统和存储系统能够使用标准以太网,在速度和端口数方面获得几乎无限的可扩展性。

RDMA是一种远端内存直接访问技术,具有高速、超低延时和极低CPU使用率的特点,最早专属于Infiniband架构,随着网络融合大趋势,出现RoCE和iWARP,使得RDMA得以部署在目前使用最广泛的以太网上。

目前其他可扩展处理器使用的是专用网络协议,而Gaudi使用的是通用以太网协议,这使得客户可以轻松将Habana硬件放进现有的数据中心,使用各网络提供商提供的标准以太网交换机来构建AI集群。

之前NVIDIA创始人兼CEO黄仁勋也在GTC 2019的主题演讲中,特意提到scale up(纵向扩展)和scale out(横向扩展),他认为scale up带来的回报并不十分有效,而scale out最好办法是在传统以太网上支持RDMA。

而被NVIDIA以69亿美元的高价收购的数据中心InfiniBand网络的绝对王者——以色列创企Mellanox,其核心技术正是RDMA。

Habana Labs团队对NVIDIA的这一观点非常认同,以此为基础,他们发展出和NVIDIA并不完全相同的路径。

NVIDIA Tesla V100支持RDMA需要通过PCIe交换,而Habana Gaudi单芯片直接与RoCE RDMA相连,此外Gaudi片上集成了10个100GbE RoCE RDMA,数量上比NVIDIA更多。

在Gaudi内部的10个以太网端口中,有7个用于连接其他的Gaudi处理器,余下3个端口则可以用于外部连接,这消除了对NIC的需求。

凭借Gaudi处理器,Habana Labs的客户亦可利用标准以太网交换进行AI训练系统的纵向扩展和横向扩展。

另外,与Habana的标准设计相比,基于GPU的系统依赖于专有的系统接口,对系统设计人员来说,这从本质上限制了可扩展性和选择性。

二、两种规格计算卡,媲美NVIDIA DGX-1的超级计算系统

Gaudi处理器配备32GB HBM-2内存,目前提供两种规格:

HL-200 – PCIe卡,设有8个100Gb以太网端口,可以直接替换现有服务器中的V100卡;

HL-205 – 基于OCP-OAM标准的子卡,设有10个100Gb以太网端口或20个50Gb以太网端口。

每个HLS-1内置8个HL-205子卡,这与DGX-1中内置的V100数量相同,而除此这一共同点外, HLS-1和NVIDIA DGX-1超级计算机主要存在4处不同:

1、DGX-1使用私有协议NVLink,这种互联方式只能实现片与片之间的互联,不能实现跨越式连接; HLS-1的片上计算和标准RDMA RoCE使其可以同时做到纵向扩展和横向扩展。

2、DGX-1的内部互联存在阻塞,HLS-1的全交叉互联无阻塞。

3、每个DGX-14有4个对外的100Gb以太网端口,每个 HLS-1拥有24个对外的以太网端口。

4、DGX-1的PCIe在传输性能上有损失,而HLS-1和传输和管理走不同的线,不会出现复用情况,因此不会造成外部主CPU的传输瓶颈。

模型并行化处理中,DGX-2提供的NVLink端口有限,最多支持16个GPU连在一起,而Gaudi可以做到成百上千个并行化模式处理。

这也是为什么RDMA被集成到芯片中,通过内置标准以太网接口,以及提供支持标准规范的模组,客户可以拥有更自由的选择权,未来训练的边界也被进一步扩展。

三、首代AI推理处理器:性能比NVIDIA T4高3倍

2018年9月,Habana Labs的首款AI推理处理器Goya发布,同期面向客户销售,并在去年第四季度实现量产。如今9个月过去了,Eitan Medina说,Goya仍然是市场上性能最领先的AI推理芯片。

AI推理市场正在不断增长,据Eitan Medina介绍,现在市面上还没有达到完全令人满意的产品,他们90%客户还是使用CPU做推理和预测,但这些客户也在寻找更高吞吐量、更低延迟和功耗、更小尺寸和更低成本的产品,而Goya能为他们带来这些性能的改善。

Goya处理器拥有两大特性:专为AI设计,软件可编程。另外它还有三大优势:高算力、高性价比、允许多个用户共享计算资源。

结语:AI芯片创企共临问题:落地与生态

Habana Labs首席执行官David Dahan表示,AI模型训练所需的计算能力每年呈指数增长。因此,提高生产率和可扩展性,解决数据中心和云计算对算力的迫切需求成为至关重要的任务。

面向对高性能AI芯片拥有刚需的数据中心领域,Habana Labs已经将其产品组合从AI推理处理器扩展到AI训练处理器,以高性能、低功耗、可扩展、可编程等特性,提供又一种新的云端AI芯片选择。

但NVIDIA之所以能多年稳坐云端AI芯片的霸主之位,除了其GPU拥有和深度学习相契合的大规模并行计算能力外,其被CUDA软件平台也功不可没,正是GPU+CUDA的强强联手为NVIDIA积累起庞大的用户群,以此为基础建立越来越完善的生态系统。

Habana Labs的云端AI芯片在性能上已经有所突破,而下一步就是所有云端AI芯片创企共同面临的问题:落地、稳定增长、还有修筑起稳健的生态。