
1 t3 j! ]: i( K: u; O2 } A* M7 e1 j6 A, c: M. L6 u: x6 z6 s( |
$ w4 ^7 w. `0 W; n* F ^10月23日,在北京召开的2019 Arm技术峰会上,Arm正式发布了全新的Ethos-N77/N57/N37系列NPU IP,进一步加码人工智能(AI)计算。与此同时,Arm还推出了针对主流移动游戏市场的高能效的Mali G57 GPU和针对主流及入门级市场的单位面积最高效的Mali-D37 DPU。1 R8 d' N7 R% O& B N" H) |! O
( P1 [; G! [ V) ?
# X/ x' ~( L3 m' l0 oARMv8及后续架构将不受限制的继续支持中国合作伙伴!: Z) z3 w {8 j3 h
$ ^. n _# I7 z* o, \$ e' B
! r+ Y0 [2 F+ ?6 O今年9月25日,Arm中国在深圳召开媒体沟通会,针对此前外界盛传的“Arm断供华为”一事,Arm表示与华为仍是合作伙伴,ARMv8及后续V9指令集可继续授权!- p( T7 Y: c4 \8 [& P! ^* B) p: e8 O
# {. v3 s2 R4 t3 U: x3 Q
M* A! n: o( u- \8 g
10月23日,在2019 Arm技术峰会北京站上,Arm董事长兼CEO吴雄昂在开场致辞当中再度重申,经过法务严谨的调查及相关调整,目前无论是ARMv8,还是后续的V9架构都是源自英国的技术,将可不受限制的继续支持中国的合作伙伴!
+ Y& C% G2 u7 e a% @ u u. L" |4 v; Q7 l9 ~# X
! Z8 u& g0 m. T- p 0 ^0 p( M. T0 K
9 V+ Q' Z9 f- N
7 N; }6 W% U* u1 o! }5 s此外,吴雄昂还指出,Arm在中国的合作伙伴已经超过200家,中国合作伙伴出货的基于Arm架构的芯片已超过了160亿颗,国产SoC芯片95%都是基于Arm架构的。) u! ]$ F5 I8 ^6 l3 T$ I, Q6 O0 [& R
0 \1 p; W' A2 c# v9 o0 B* m% j, X, \" V
吴雄昂强调,Arm是唯一非源于美国的主流计算架构。Arm中国承接Arm在中国的业务和技术,在Arm标准之下自主创新、赋能产能,把中国工程师能力调动起来打造知识产权。这些知识产权将不只是提供给中国产业,还要通过统一标准面向全球。. z% D: Y' v @1 }! R6 j. ^
" T. \; S2 l% E2 C
! Y' w6 e. y+ w8 x, _6 ^加码AI计算,Arm发布Ethos系列NPU IP
8 {2 q' e2 C% V" x, c' i2 s
, F0 q0 X% h1 E [2 K) `+ Q5 l; R( y: @
根据Arm及研究机构的预计,到 2028 年,移动设备的数量将从现在的17亿台增长到 22 亿台,智能的IP Camera将由现在的1.6亿台增长到13亿台。在终端侧具有人工智能的设备将会由现在的3亿台增长到32亿台。足见人工智能市场增长之迅速。) y9 B, w- s, c) W+ j0 q# Y1 F
% p6 S7 e7 b( ~; W
% f& Z6 V" E0 t+ e7 f
而随着AI技术的兴起和广泛应用,AI对于芯片的算力也提出了更高的要求。作为全球最大的处理器IP供应商,Arm的Cortex CPU和Mali GPU在以智能手机为代表的移动终端市场占据了极大的市场份额,但是在AI计算领域,Arm此前一直都是依托于其Cortex CPU、Mali GPU及相关软件开发工具来提升其AI计算的能力。, B3 p9 F4 X/ H# X5 Y' l. o
/ w) P) T8 r+ U! X1 m7 o+ s$ \% f
& E; k$ H3 _( |# `4 T1 w) Q' ]
但是,传统的CPU、GPU核心并不是AI计算的最佳载体。因此越来越多的芯片厂商开始推出了AI专用芯片,或者在SoC当中加入AI计算专用的NPU内核。比如华为2017年就率先推出了集成NPU内核的麒麟970处理器,同时苹果推出的A11处理器也首次集成了NPU内核。此后,高通、联发科、三星、展锐等手机芯片厂商也纷纷开始在SoC当中集成自己的NPU内核。
y! k' I0 d- ^2 U3 ~' z1 _; X# J9 u7 x3 o6 _0 W- Q" C9 u5 n5 l
2 G+ Q" Y( N7 t0 i在此趋势之下,为了应对市场对于AI内核的需求,Arm在2018年年初也公布了针对AI的Project Trillium项目,其中就包括了全新的机器学习处理器IP、目标检测处理器IP和神经网络软件库。经过了近两年的时间,现在Project Trillium项目的成果也开始正式产品化。 X) S# i0 o! d: d7 @
0 p4 x8 i0 ]3 q8 m% f3 c
/ g, W" e7 X' h5 F
: J2 T/ @: i. w- g4 D
( \1 Q f4 Q+ h+ [% O. d) G$ E. { {' B
* |& Z9 o r; J# F1 k/ B$ n" r
: Z: E# c& T; n" J9 ^: C
今天,Arm市场营销副总裁Ian Smythe 在Arm技术峰会上正式发布了全新的Ethos系列NPU IP,包括针对高端市场的Ethos-N77、针对主流市场的Ethos-N57和低端市场的Ethos-N37。
: @+ r6 m2 M2 `5 w+ I) ^) a7 g/ @7 H+ V! v" `
% [) @' `6 Q) H7 U3 x

2 D! M+ a. h% x( G! M. R' N + \) ^, F! j, k7 ~! `
8 Y' y4 K, z$ g! {
# P5 a" L8 w- M' G3 Z" p6 _& K- ?" dEthos-N77实际上就是Arm去年公布的Project Trillium项目中的那款机器学习处理器IP,其内部集成了可配置的1-4MB的SRAM,在1GHz主频下,7nm工艺下,可以提供最高4 TOPS的AI算力,每瓦性能高达5 TOP。另外,之前Project Trillium项目公布的数据显示,Ethos-N77的单位面积算力为4.6 TOPs/mm²(最新发布的可能有进一步提升)。那么Ethos-N77的这个性能在市场上处于什么水平呢?
" @2 c9 N$ [5 r h : [; A+ x- t3 C
根据资料显示,华为麒麟970 NPU是基于寒武纪1A IP,算力是1.92TOPS。而苹果A11的NPU算力仅为0.6 TOPS,A12的NPU性能为5TOPS。而根据此前高通骁龙855发布之时的数据显示,其整体(包括CPU+GPU+DSP等)的AI算力(超过7 TOPS)是华为麒麟980的两倍,照此估算的话,麒麟980的NPU性能大概在3.5 TOPS左右。另外据芯智讯了解,华为麒麟980的NPU是基于寒武纪IH8,是针对低功耗场景视觉领域的NPU内核IP,而寒武纪IH8有 4 种可选的配置1T、2T、4T、8T OPS@1GHz,麒麟980应该是4TOPS的版本。而麒麟990系列的NPU并未公布具体的OPS数据,不过其采用了全新的达芬奇架构以及两个大核+一个小核的配置,性能应该更强。5 _& a& F. t4 c5 `8 k! x$ N9 U8 D
3 _! C4 N: p& A7 T. E
- c ^' a- G- r8 W# u. S% @ T/ g1 E$ `! n, c O- W* h
在单位面积的算力方面,根据芯智讯此前的估算,麒麟970的NPU的单位面积性能大概是1.48 TOPs/mm²,而麒麟980和990没有相应数据可以参考。而根据TechInsights的拆解,苹果A12的NPU内核的面积为5.79mm²,也就是说苹果A12的NPU的单位面积算力约为0.86TOPS/mm²。) \7 C# f) W+ U# r( o) B
8 u i4 H& p0 j7 p
& u7 O2 h7 E2 t3 C3 O; c3 w在每瓦算力方面,华为公布的资料显示,麒麟810的每瓦算力可以达到6TOPS。苹果的NPU未有相应数据。寒武纪新的NPU内核1M在7nm下每瓦性能为5TOPS。& I r# X. J' d1 P2 g
9 _0 l7 s4 [- X; Z. T4 b* ^
" x5 M: H8 ~# J* M
从上面的数据对比来看,Ethos-N77的AI性能与苹果A12和麒麟980的NPU相当,相比麒麟990系列的NPU性能可能要弱一些。在单位面积算力方面,远高于苹果A12和麒麟970的NPU。在每瓦算力方面,也是远高于苹果A12的NPU,略低于麒麟810。综合来看,Arm Ethos-N77各方面都还是比较出色的,达到了目前旗舰级NPU的水准。
4 y( r) N- d: T9 B1 o
5 ?+ h0 f1 H- o7 h; T. i* f, J- ~# l' Y3 W6 Y- V
需要指出的是,4 TOPS的性能是单个Ethos-N77核心在1GHz主频下的性能,如果配置双核的话,那么性能无疑将进一步提升,当然功耗和面积会进一步提升。
+ m, j8 o M. l
" P1 h* j; \- p, r
( C2 O4 V7 v' u/ K8 v6 dArm此前就表示,Ethos系列IP是具有高可扩展性、兼容性和可编程的,可以提供计算性能最低从2 GOPS到超过70 TOPS的产品。
. e/ Y& V: k m$ Y
% L. F1 y- a( ^5 {( ? _
/ v4 J3 K( p1 N Z( v+ x8 a- j另外,Arm还推出了针对主流市场的Ethos-N57,内置了512KB SRAM,在1GHz主频下,算力最高可达2TOPS;而针对低端市场的Ethos-N37,是为了提供面积最小的ML推论处理器(小于1mm²)而设计,其同样也内置了512KB SRAM,在1GHz主频下,算力可达1TOPS。) H7 s. K5 G6 w3 M5 C
: Y7 K. a3 n( n( O2 }3 \! u
6 t8 L8 v" D; V+ O2 E, S
Arm表示,Ethos-N57和Ethos-N37针对Int8与Int16数据类型的支持性进行了优化,通过如创新的Winograd技术的落地,使性能比同类NPU提升超过200%,并且配备了先进的数据管理技术,以减少数据的移动与相关的耗电,在ML在性能与成本、面积、带宽与电池寿命之间达成了比较好的平衡。5 @! k3 x b |4 b% f# D
3 P, ]+ R5 Q7 i, f2 x
. |1 h" p: q, d9 ^+ L& w据芯智讯了解,除了移动市场之外,Arm的Ethos系列IP未来也将会开始进入物联网、工业、汽车、网络以及服务器市场。! U4 L& G" d; s: ]6 M9 }+ w
. C s: M7 p- {& N1 A
: }9 P( N5 ^$ _9 d( e: }开源的AI开发框架Arm NN& c: _4 L d. o6 R
H+ h4 _) A. C; o! v
/ b. E, R3 Z6 r* T- Y我们都知道,此前高通骁龙845/855系列都并未内置专门的NPU内核,但是其仍然提供了较高的AI能力,而这一切得益于其神经网络引擎Neural Processing Engine的助力。即采用更为弹性的异构的机器学习架构,在通用平台内做内核优化,使得AI计算合理的分布在CPU、GPU、DSP等每个单元上,从而可以针对不同移动终端提供弹性调用各个处理单元来进行AI计算。2 @6 b# }( A' z$ z
8 p( B1 S/ J; ~8 g$ P
' E, }' Q2 g- _$ O( F6 f而Arm此次在发布Ethos系列NPU IP的同时,也推出了开源AI开发框架Arm NN,强化异构的AI计算,进一步提升整体的AI性能。
; M7 N/ g" d' t( D J& j$ O5 w
2 ~# e3 Z2 H* O& Z
0 G8 u o( b' c; j/ |
; j! p- n) @1 C1 }- [/ s5 U3 X% w! U
' f4 o" F0 V6 W+ @% L8 i! _
% O0 M+ X! y; l8 O7 X4 l/ C V4 }据介绍,Arm NN是属于偏底层的架构,而且在其基础之上,可以支持其他的更高层级第三方的NN框架,并提供完整工具链,可实现在AI计算上对于Arm CPU/GPU/NPU内核的合理调用,实现更高效的异构的AI计算。, @ W: ]2 e) i' z2 r3 u0 h
" i, }0 q% Y5 o8 k* _, j0 U
6 h0 L) \5 z( r
Arm表示,由于不同的SoC对于AI的加速方法是不一样的,因此第三方应用及开发者要用到片上系统的加速能力是比较困难的。而开源的Arm NN的推出,将降低开发者调用Arm内核的难度,进一步提升开发人员的体验。
9 W8 H; T, k) j( d; d1 N. p
9 J7 T# t) ` c/ U; r5 a0 q' N2 Q) `9 z
( M, [( ?' t, y j) w
5 ]1 b s& G/ ?; N' b4 u! E) }( z+ I- k
' w. b% x; N) c) |+ R5 U5 J& E
此外,为了推进基于Arm NN的内容创建和开发,Arm还与Unity(Unity最目前主要的3D引擎,50%的3D游戏,75%的VR内容都是基于Unity引擎开发)达成合作,进一步优化Unity引擎,使得基于Unity的开发者能够更容易的访问和更高效的利用Arm的内核,在Arm CPU/GPU/NPU之间获得更好的性能。可以实现一次开发,即可获得Arm全系列的内核的支持(即可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。" h2 o$ Y) i' o+ ?) Q9 x
" F, ]! Z$ A: Q! y* f) Y f
" X; S& p8 ?; }! K* R' Z! H& fMali G57 GPU:为主流市场带来智能与沉浸式体验) S; y- H. {( r
7 p5 C4 V/ F3 M0 {+ l7 O. z$ y: I5 I4 ?
今年6月,Arm针对高端市场推出了首款基于全新Valhall架构的GPU——Mali-G77。今天,Arm针对游戏市场推出了第二款基于Valhall架构的高性能、高能效的GPU内核——Mali-G57。(Vahall架构进一步提升了并行执行的能力,同时在代码上也做了尽量的简化,从编译角度来讲也更加友好。)3 D8 y8 |' |( Q7 }% h1 y! r2 E
: m5 W! ]8 Z0 y- S) K! @
! x/ @( `5 q: |4 R1 @ 7 d2 u: K+ _7 A5 X$ f- X8 k
4 }. R0 k" D; y0 B2 U
$ i3 q. c+ J0 m据介绍,Mali-G57的性能相比上一代的Mali-G52在能效上提升了30%,性能密度提升了30%,机器学习性能提升了60%。并且Mali-G57还加入了针对虚拟现实(VR)提供注视点渲染支持,再加上机器学习性能的提升,可以支持更复杂的XR实境应用。而且,Mali-G57还支持1-6个核心的配置,可以满足不同市场定位的智能手机的需求。
( q5 S) Q$ K4 J/ t& N5 k: U* O" h9 d, [- B( K( A; d; M9 {1 m
$ Q5 {# F, [) i% DArm表示,Mali-G57可以将优质的智能与沉浸式体验带到主流市场,包括高保真游戏、媲美电玩主机的移动设备图型效果、DTV的4K/8K用户接口,以及更为复杂的虚拟现实和增强现实的负荷。
3 H5 ~9 r4 t2 d) Z7 P* i# }! m
8 E" J/ a& u" |
& D' z) e, v$ P! ?: x0 U9 t: ?: _Mali-D37:Arm单位面积效率最高的DPU
$ E# A6 L- l$ p Z: N8 I% O$ h: I0 W; _7 a1 y9 o$ k7 G- W8 O
9 L8 G* B. Z6 S$ V在今天的技术论坛上,Arm还推出了目前单位面积最高效的显示处理器Mali-D37。
; M" ]$ A6 S; F- F# ~: e' |. `0 }# G- D7 `: l% G& j8 u% c0 H8 A- K5 z- Z' \
; C" b E9 p2 `
0 ^# O% R" i8 q& ~! v1 w; a: p; o
0 v, ~/ C3 H' l+ U& p: \( Z
' e4 P* s. b, Q据介绍,Mali-D37是Arm第一个面向主流市场的基于Komeda架构DPU,拥有极高的单位面积效率,在支持全高清(Full HD)与2K分辨率的组态下,16nm制程的面积将小于1mm²。. h7 k5 Z6 _" m8 Y6 O: ?
/ O6 |" p. i3 |% h) C: H
} X) L* S: D0 v3 i: K1 U* ~7 Q9 ~" Y在性能方面,Mali-D37保留了高阶的Mali-D71关键的显示功能,包括与Assertive Display 5结合使用后,可混合显示高动态对比(HDR)与标准动态对比(SDR)的合成内容。另外,Mali-D37其通过将部分GPU核心显示的工作负载卸载到Mali-D37来工作,以减少GPU的工作以及对于内存的访问,使得系统的功耗可以降低30%。
3 w% H; ]$ m+ {7 \, Y
+ S6 M, W! V$ U7 W) Z5 e( b1 X$ G5 h' x* o% j* b% J) [
Arm表示,Mali-D37可以支持入门级智能手机、平板电脑等成本较低的设备,获得2K级别的视觉效果与性能支持。& }2 A6 I7 O* r4 T8 e
6 Q; w9 f. ] b% F. }, t4 H
# W4 m2 `0 e: U5 a4 [2 [Arm的通用型NPU能否获得成功?
! {9 p. `& z( Z. Z3 B
9 a3 C. Z3 J+ k# s' |# i8 e1 R& Y& |: ^
从目前的市场趋势来看,AI芯片正越来越向专用化的方向发展,越来越多的算法厂商也都纷纷基于自身的算法推出了自己的AI芯片。同样,正如前面我们所提到的,目前华为、苹果、高通、三星、展锐等众多的手机芯片厂商也都有推出自己的NPU内核。那么Arm的“通用型”的Ethos NPU IP真的有市场吗?
/ [1 e5 E7 p* V2 A8 z
- R' |0 P5 x! l7 q
- d6 W8 W. N+ L$ _! w对此,Arm市场营销副总裁Ian Smythe表示,Arm的Ethos NPU IP并不是孤立存在的,其主要的优势在于,在其本身提供出色的AI性能的同时,可以更好与Arm的CPU、GPU进行协同,以实现异构的AI计算,从而进一步提升整个系统层级的AI性能、降低功耗。而且,目前AI市场还是在初期,很多的AI算法仍在快速迭代,选择“通用型”的NPU是比较安全的做法。0 X# {& O" u5 G
) \# ?" w. N( H: q! V0 T1 g
; W( h8 n0 B9 O; r+ v; T2 H( {9 j0 ]0 x2 R8 o. j+ ?, f
* l1 o: P7 w7 Y% `: o9 v2 I" r
2 u( w9 G G% ?在采访当中,Ian Smythe向芯智讯确认,Arm的Ethos NPU IP也可被集成于比如RISC-V等其他架构的SoC当中,但是Ian Smythe也强调,这样并不能发挥出Ethos NPU与其它非Arm CPU/GPU在AI计算上的协同优势。, K- @6 f% X: h c; c* H
4 d% S7 y4 D8 g9 G
! _' e* X& h. i' D3 D
另外,Arm的Ethos NPU IP还实现了对于高中低阶的全面覆盖,但是目前众多的芯片厂商主要还是在其高端SoC当中集成了NPU,而随着AI计算向边缘侧部署的趋势,未来市场对于NPU的需求也将会越来越大。Ethos NPU IP的推出,将可帮助芯片设计厂商更简单、更低成本的获得不同档位的NPU内核的支持。5 o1 k; K: m6 z; t+ M- [- _6 U
9 f( `$ P! T6 U" D
4 N! T" r/ h6 ]* R$ j! _ g8 ]另一方面,目前的Android应用生态基本都是基于Arm架构的处理器,因此,如果采用Arm的Ethos NPU IP,结合开源的Arm NN框架,应用开发者将可以更简单、高效的调用Arm的CPU/GPU/NPU内核,可以为用户带来更为出色的AI体验。而且,可以实现一次开发,即可获得Arm全系列的内核的支持(这也意味着,可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。而对于其他的芯片厂商的NPU来说,开发者要想实现灵活高效的调用NPU,充分发挥其AI性能,则需要针对性的进行优化,而且还需要其提供相应的权限和工具。即便是开发者开发应用实现对于A厂商的NPU调用,同样的应用要想实现对于B厂商NPU的调用,可能需要重新进行编译。显然,对于应用开发者来说,Arm的NPU所具备的生态优势无疑是其他厂商所无法比拟的。9 J" O4 K9 h+ o. Z9 ?4 j( d
# S9 q1 S8 Y1 q2 U( _
! T7 f$ x# l! {1 E+ {8 X6 I: I1 M最后,Ian Smythe强调,Arm对于AI性能的提升是多维度的,一方面会持续推出更高性能的NPU IP,同时也在不断提升Arm CPU/GPU的AI性能。) }, w5 F3 x9 h+ @1 d. D. V. p7 f
+ s3 m2 H) A5 E1 t) Q
9 M' c# e% h' U3 N! J8 ^9 P, k
- o& g+ @& v% i3 W2 B% ?& S( l9 d5 c$ Y y
( O* R4 N" @9 Z. Q1 ]: A
值得一提的是,Ian Smythe在演讲当中透露,Arm在下下一代的大核架构Matterhorn当中,加入Matrix Multiple(MatMul),令其ML(机器学习)性能与前代CPU相比提升一倍。
1 c- D0 }- x* T; H* k; f3 p. r2 O, Z! a+ V* X. n, m
+ B+ T+ j8 |6 U* f& {2 Q9 T9 {
编辑:芯智讯-浪客剑
. V9 c/ F4 @/ z往期精彩文章4 d; [5 A$ Z, ~+ v
VR市场迎来第二春:5G+VR云化将成最大推力!, B; H8 h2 F y/ N
1 G* z! U. [/ W* I2019生物识别论坛成功落幕:这十大看点不容错过!
! F8 v; X4 {/ Y- D阿里平头哥正式开源RISC-V架构MCU芯片平台
- _ R! v- a6 q; S) m6 I首度杀入3D人脸识别门锁/门禁市场,英特尔为何选择与小钴科技结盟?1 D# x5 ^4 @7 s
1 q# ^6 I; A2 e展锐再推4G功能机芯片虎贲T117,意义何在?
8 Q4 V2 q- T$ q0 @" E {* s* j! I/ c# x$ X* N) g; Y
历史首次!华为海思4G芯片Balong 711对外销售!: Z4 S: w7 Y! _
7 @ X* q' _3 P# C$ F7 Z3 j不惧美国打压!华为已获得65份5G商用合同,5G基站发货超40万个!
[$ q: @" Y9 _" B6 D
! X6 I! Y' i7 @, z+ F6 X巨额债务违约+资金链断裂?手机ODM厂商海派关厂裁员!- b7 ]& S- u! J- \7 T$ Z
# r ^6 G& x1 O" R% s可穿戴巨头Fitbit宣布撤出中国!0 a3 p. f4 W. A& k
( @& y* }# L2 C% `0 `" z收购Intel基带芯片业务涉嫌违规?苹果遭市监总局启动问询1 k, v( {% R+ f) J" K, S b
& |) U% `4 k. d& t: N# ]% K3 ?' p7 D. ]9 n
禁令之下,安防巨头海康与大华的应对之策!. ]5 N& S! H0 |5 g N
/ i- x3 g* N8 ?: ^8 {4 t- m: ?. h为应对RISC-V挑战?Arm CPU引入自定义指令功能!( u, y, A( I6 ?0 q4 i
行业交流、合作请加微信:icsmart01$ N" t) c, o+ \3 R/ r* H
芯智讯官方交流群:221807116
" U# _. t: t- C3 Q
( x- m1 A% @# R: Y$ i5 A来源:http://mp.weixin.qq.com/s?src=11×tamp=1572103805&ver=1936&signature=jeCKwe1UBQzC*Pzs8GoY9TZBvEs1rdMAvR4c22h3Cpdg-qQ*TOrpE2uZ4YvRMx7pQMFu5Q-as9lkvJgPIZqWm1WA-*ncmgAC2Ls6p79VafFsjOW9cM78m6hG7c-lzR2Q&new=1( X# p" C) |" X
免责声明:如果侵犯了您的权益,请联系站长,我们会及时删除侵权内容,谢谢合作! |