|
|
- A: J% e9 |" N
5 [7 R5 {8 ?) g, J
/ V- f: G# s6 [$ @8 ~. T10月23日,在北京召开的2019 Arm技术峰会上,Arm正式发布了全新的Ethos-N77/N57/N37系列NPU IP,进一步加码人工智能(AI)计算。与此同时,Arm还推出了针对主流移动游戏市场的高能效的Mali G57 GPU和针对主流及入门级市场的单位面积最高效的Mali-D37 DPU。
7 Y. b) m# ~0 m& @ |/ B8 ]3 f5 `& T- C' a6 q
) b. m j3 O2 L4 dARMv8及后续架构将不受限制的继续支持中国合作伙伴!
U5 R" W! i, B9 N# y% C! i1 \, C p4 w$ E- J; j
8 H) w: V4 y1 b- G2 \$ V今年9月25日,Arm中国在深圳召开媒体沟通会,针对此前外界盛传的“Arm断供华为”一事,Arm表示与华为仍是合作伙伴,ARMv8及后续V9指令集可继续授权!1 f' d% ]. ^3 o/ C4 ?
4 P& P6 N! }9 N) o# T+ `! u4 y% D. Z' y# }7 v% g4 K
10月23日,在2019 Arm技术峰会北京站上,Arm董事长兼CEO吴雄昂在开场致辞当中再度重申,经过法务严谨的调查及相关调整,目前无论是ARMv8,还是后续的V9架构都是源自英国的技术,将可不受限制的继续支持中国的合作伙伴!! z) Z8 h( M4 p% _0 K4 j. q* G1 ~0 W" G3 u
3 m5 S l8 h0 u% B
( H1 r4 S. ?# E6 b, M4 V0 ]
/ X+ A. h8 |6 ~: N+ v- [3 g
2 p( l$ q" L) A! X' B' u( h ?
) F# R! A$ @* o8 S/ |5 J4 f此外,吴雄昂还指出,Arm在中国的合作伙伴已经超过200家,中国合作伙伴出货的基于Arm架构的芯片已超过了160亿颗,国产SoC芯片95%都是基于Arm架构的。0 q% t: n. i/ a5 b
' n5 @5 Y$ n4 i3 L- l1 N( P/ y g$ q* Q
吴雄昂强调,Arm是唯一非源于美国的主流计算架构。Arm中国承接Arm在中国的业务和技术,在Arm标准之下自主创新、赋能产能,把中国工程师能力调动起来打造知识产权。这些知识产权将不只是提供给中国产业,还要通过统一标准面向全球。; l2 R) K: `9 q N3 _5 z
" q8 N) h, x! I5 P2 x% s7 v1 {. U4 R: O" ?% y# `
加码AI计算,Arm发布Ethos系列NPU IP
- D# z6 H0 [: M: h2 `) t j8 {- m& g9 A/ ^4 {+ `: C
% U* B6 s4 N7 c" j" A7 `- ]根据Arm及研究机构的预计,到 2028 年,移动设备的数量将从现在的17亿台增长到 22 亿台,智能的IP Camera将由现在的1.6亿台增长到13亿台。在终端侧具有人工智能的设备将会由现在的3亿台增长到32亿台。足见人工智能市场增长之迅速。
( a+ n# O, i. k& S4 U: |0 X$ d4 @: o9 E& C9 M/ K
$ {" G! A7 z% u, R' l1 x5 O$ l5 D2 [
而随着AI技术的兴起和广泛应用,AI对于芯片的算力也提出了更高的要求。作为全球最大的处理器IP供应商,Arm的Cortex CPU和Mali GPU在以智能手机为代表的移动终端市场占据了极大的市场份额,但是在AI计算领域,Arm此前一直都是依托于其Cortex CPU、Mali GPU及相关软件开发工具来提升其AI计算的能力。
! z" ?3 _5 B, `/ z3 L6 S
O; T0 d# w, V% t. s: V: e! `% G6 M0 b- g
但是,传统的CPU、GPU核心并不是AI计算的最佳载体。因此越来越多的芯片厂商开始推出了AI专用芯片,或者在SoC当中加入AI计算专用的NPU内核。比如华为2017年就率先推出了集成NPU内核的麒麟970处理器,同时苹果推出的A11处理器也首次集成了NPU内核。此后,高通、联发科、三星、展锐等手机芯片厂商也纷纷开始在SoC当中集成自己的NPU内核。' [6 e5 s5 {" j
/ A& z" s2 J7 ~
* n0 S [4 g& ^9 k0 w5 N在此趋势之下,为了应对市场对于AI内核的需求,Arm在2018年年初也公布了针对AI的Project Trillium项目,其中就包括了全新的机器学习处理器IP、目标检测处理器IP和神经网络软件库。经过了近两年的时间,现在Project Trillium项目的成果也开始正式产品化。
1 v+ s+ H4 a# H
. o4 M8 U2 m! C9 x1 p0 x' h: d8 W+ Y6 i. s
$ ^( g* {, ]1 B% U" w
% W4 o4 Z [6 K2 c2 i3 b0 y7 C0 }+ K$ w: L
% C! S% W; b; W& n% [+ X
5 N/ Q% T5 _$ t- Q3 z) W今天,Arm市场营销副总裁Ian Smythe 在Arm技术峰会上正式发布了全新的Ethos系列NPU IP,包括针对高端市场的Ethos-N77、针对主流市场的Ethos-N57和低端市场的Ethos-N37。
: y4 W- A+ i4 [% h2 k/ S( W, J: [
0 w1 C6 x' C" i/ N
, g3 j; e1 T' H' q- k2 V
5 O5 \& o8 [6 E; x4 j, G& z- t, J6 W % `! B( q" u. p( `, {' ]# E8 R
' g# B9 n9 V; g: M
% R1 ?* I: A& d" R C# U7 ]& J, OEthos-N77实际上就是Arm去年公布的Project Trillium项目中的那款机器学习处理器IP,其内部集成了可配置的1-4MB的SRAM,在1GHz主频下,7nm工艺下,可以提供最高4 TOPS的AI算力,每瓦性能高达5 TOP。另外,之前Project Trillium项目公布的数据显示,Ethos-N77的单位面积算力为4.6 TOPs/mm²(最新发布的可能有进一步提升)。那么Ethos-N77的这个性能在市场上处于什么水平呢?: I" F9 j V, h$ D n9 R/ f

6 y& B9 @9 v8 B* N根据资料显示,华为麒麟970 NPU是基于寒武纪1A IP,算力是1.92TOPS。而苹果A11的NPU算力仅为0.6 TOPS,A12的NPU性能为5TOPS。而根据此前高通骁龙855发布之时的数据显示,其整体(包括CPU+GPU+DSP等)的AI算力(超过7 TOPS)是华为麒麟980的两倍,照此估算的话,麒麟980的NPU性能大概在3.5 TOPS左右。另外据芯智讯了解,华为麒麟980的NPU是基于寒武纪IH8,是针对低功耗场景视觉领域的NPU内核IP,而寒武纪IH8有 4 种可选的配置1T、2T、4T、8T OPS@1GHz,麒麟980应该是4TOPS的版本。而麒麟990系列的NPU并未公布具体的OPS数据,不过其采用了全新的达芬奇架构以及两个大核+一个小核的配置,性能应该更强。; H$ u5 ~5 \* R. m0 P# Y
" M' |+ @3 v5 @
& q+ u( P; j2 m' \% h# x
: A- G9 D/ H: V; ~" {在单位面积的算力方面,根据芯智讯此前的估算,麒麟970的NPU的单位面积性能大概是1.48 TOPs/mm²,而麒麟980和990没有相应数据可以参考。而根据TechInsights的拆解,苹果A12的NPU内核的面积为5.79mm²,也就是说苹果A12的NPU的单位面积算力约为0.86TOPS/mm²。
& Y3 H& b" g- R. ]! R3 G% c8 L* _
; @% g$ r5 f- k4 l
7 ^# k, l. B" l0 U) P在每瓦算力方面,华为公布的资料显示,麒麟810的每瓦算力可以达到6TOPS。苹果的NPU未有相应数据。寒武纪新的NPU内核1M在7nm下每瓦性能为5TOPS。! m! j- M8 P9 J* r; e' p6 X, M; v
% S9 `8 R# e0 h) v' ?
$ r" p) q1 r1 \% ~% C
从上面的数据对比来看,Ethos-N77的AI性能与苹果A12和麒麟980的NPU相当,相比麒麟990系列的NPU性能可能要弱一些。在单位面积算力方面,远高于苹果A12和麒麟970的NPU。在每瓦算力方面,也是远高于苹果A12的NPU,略低于麒麟810。综合来看,Arm Ethos-N77各方面都还是比较出色的,达到了目前旗舰级NPU的水准。; L6 I) w& W, q1 w7 u9 `* z( {
7 r- \6 H7 Y1 ~
# j; e9 i. I- ]) j7 f* g1 u需要指出的是,4 TOPS的性能是单个Ethos-N77核心在1GHz主频下的性能,如果配置双核的话,那么性能无疑将进一步提升,当然功耗和面积会进一步提升。) L4 Y/ ^8 {# u8 R( j2 X8 M
8 @3 J2 C' {4 E4 [7 x C* [
2 ~9 V1 r* r, \' x rArm此前就表示,Ethos系列IP是具有高可扩展性、兼容性和可编程的,可以提供计算性能最低从2 GOPS到超过70 TOPS的产品。
) P0 u' ^( L8 v2 ~! E: c* V. {1 [0 Z2 P [
/ v% P @+ X+ n+ i$ w
另外,Arm还推出了针对主流市场的Ethos-N57,内置了512KB SRAM,在1GHz主频下,算力最高可达2TOPS;而针对低端市场的Ethos-N37,是为了提供面积最小的ML推论处理器(小于1mm²)而设计,其同样也内置了512KB SRAM,在1GHz主频下,算力可达1TOPS。
; a l4 a1 V7 Y% I4 J
+ `/ w+ Y& w4 @: B
$ y) p# h* \3 ^4 FArm表示,Ethos-N57和Ethos-N37针对Int8与Int16数据类型的支持性进行了优化,通过如创新的Winograd技术的落地,使性能比同类NPU提升超过200%,并且配备了先进的数据管理技术,以减少数据的移动与相关的耗电,在ML在性能与成本、面积、带宽与电池寿命之间达成了比较好的平衡。0 G4 X7 s+ M& J" w4 p4 S* \0 r
2 R$ m( a) A) s2 z' [$ m
7 H/ o% U0 Y+ d
据芯智讯了解,除了移动市场之外,Arm的Ethos系列IP未来也将会开始进入物联网、工业、汽车、网络以及服务器市场。
6 N7 r3 y) a E; r7 c) T3 O
2 ~6 k8 s3 R4 C8 o& ^) Z1 D) J. o8 i2 {' u8 Z
开源的AI开发框架Arm NN
- S) r6 `# Z: o% w5 v* T( ?
5 W6 w6 {* I: V& F
2 Y8 L3 J& ~ h! _7 \我们都知道,此前高通骁龙845/855系列都并未内置专门的NPU内核,但是其仍然提供了较高的AI能力,而这一切得益于其神经网络引擎Neural Processing Engine的助力。即采用更为弹性的异构的机器学习架构,在通用平台内做内核优化,使得AI计算合理的分布在CPU、GPU、DSP等每个单元上,从而可以针对不同移动终端提供弹性调用各个处理单元来进行AI计算。
) m& ?" t7 {; g& J
) L2 g; E/ X! y% \$ \1 }$ m/ S. z; Y' y; L, Z
而Arm此次在发布Ethos系列NPU IP的同时,也推出了开源AI开发框架Arm NN,强化异构的AI计算,进一步提升整体的AI性能。
* @. j5 ^6 g! Y- p; r5 B4 N2 U3 G+ ~# A( X2 b4 K5 A
% C& I% O7 `: z' v+ I6 z: G * }% }3 O6 x' K! X
# ?: l2 |# z. i$ F7 ~' o" G" I
" W1 M7 V+ U Y# X5 |: ]据介绍,Arm NN是属于偏底层的架构,而且在其基础之上,可以支持其他的更高层级第三方的NN框架,并提供完整工具链,可实现在AI计算上对于Arm CPU/GPU/NPU内核的合理调用,实现更高效的异构的AI计算。
3 W ]" `( P/ v# L8 M% P/ f9 |" d& ]; l# j: T' y4 J6 T
a9 ]# K5 T9 x. B7 \+ L! |
Arm表示,由于不同的SoC对于AI的加速方法是不一样的,因此第三方应用及开发者要用到片上系统的加速能力是比较困难的。而开源的Arm NN的推出,将降低开发者调用Arm内核的难度,进一步提升开发人员的体验。6 E/ X6 P; q- o$ p, J n/ E4 K$ {
+ u4 e9 ?0 a( W
3 Q$ n2 ]# D' i6 k1 Q- C
( W9 {2 N1 l, `9 i3 ^8 U) b& r1 D/ D8 f. T& M- N% {$ D6 d( `9 r+ p
3 `% _1 H4 ^( ~. ]( s
此外,为了推进基于Arm NN的内容创建和开发,Arm还与Unity(Unity最目前主要的3D引擎,50%的3D游戏,75%的VR内容都是基于Unity引擎开发)达成合作,进一步优化Unity引擎,使得基于Unity的开发者能够更容易的访问和更高效的利用Arm的内核,在Arm CPU/GPU/NPU之间获得更好的性能。可以实现一次开发,即可获得Arm全系列的内核的支持(即可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。$ a& k( F$ X; ? |* Z
0 |4 P, r& B3 L( @# r+ c
$ h1 I7 a: d$ `( A1 VMali G57 GPU:为主流市场带来智能与沉浸式体验9 S9 T4 Y: O7 n0 ^
( l: | r- I: D6 r, Y/ [, }" N* D$ N% X) q1 g" J
今年6月,Arm针对高端市场推出了首款基于全新Valhall架构的GPU——Mali-G77。今天,Arm针对游戏市场推出了第二款基于Valhall架构的高性能、高能效的GPU内核——Mali-G57。(Vahall架构进一步提升了并行执行的能力,同时在代码上也做了尽量的简化,从编译角度来讲也更加友好。)- t& Q# I$ j2 m! z6 b6 K5 q5 ^' m
% _ |- @0 i; p' h
+ j: u" |# L9 k# q: x" a

# W& `( i2 X5 y# m2 V
% d- S$ f* T: V. n/ }+ |/ M3 s5 j+ w
$ j& m3 P/ g: p7 h据介绍,Mali-G57的性能相比上一代的Mali-G52在能效上提升了30%,性能密度提升了30%,机器学习性能提升了60%。并且Mali-G57还加入了针对虚拟现实(VR)提供注视点渲染支持,再加上机器学习性能的提升,可以支持更复杂的XR实境应用。而且,Mali-G57还支持1-6个核心的配置,可以满足不同市场定位的智能手机的需求。4 v! M9 @# P& P# o
; e% W2 x M" x5 \% o5 r
2 o6 G) O% }( ^9 _; b2 M% o
Arm表示,Mali-G57可以将优质的智能与沉浸式体验带到主流市场,包括高保真游戏、媲美电玩主机的移动设备图型效果、DTV的4K/8K用户接口,以及更为复杂的虚拟现实和增强现实的负荷。* [- {9 n C- }! Y5 h, k0 X
/ |9 w R% v* _1 n- k
0 p/ ?: |$ C3 J" H H3 D; T* U' LMali-D37:Arm单位面积效率最高的DPU1 v$ L/ C/ R" h3 K8 ]7 B0 e! K/ K
& }& ~! o$ H n7 m' E' a) N, a0 d" d6 d; r; |/ F, V& a; o
在今天的技术论坛上,Arm还推出了目前单位面积最高效的显示处理器Mali-D37。2 o6 y2 i8 g& n+ x
3 Y1 L% }5 `, ~, k7 z5 }) J* Y" l& K# }( V1 s$ {5 r4 e& H
/ _. U, `. j! S+ p' z% l
/ Q0 x+ ?# y/ y- e+ A
/ `) M; k0 M M据介绍,Mali-D37是Arm第一个面向主流市场的基于Komeda架构DPU,拥有极高的单位面积效率,在支持全高清(Full HD)与2K分辨率的组态下,16nm制程的面积将小于1mm²。( H" @: d& |/ {6 k# y
% |1 @: _7 c2 l y* z. ^ |( t9 W$ O8 j3 B/ v( o2 |
在性能方面,Mali-D37保留了高阶的Mali-D71关键的显示功能,包括与Assertive Display 5结合使用后,可混合显示高动态对比(HDR)与标准动态对比(SDR)的合成内容。另外,Mali-D37其通过将部分GPU核心显示的工作负载卸载到Mali-D37来工作,以减少GPU的工作以及对于内存的访问,使得系统的功耗可以降低30%。- y' ]$ [3 ]9 h; M/ W% [
. v% ^+ X0 w! b* b+ n' O% ?
, i0 E7 e' h. b- pArm表示,Mali-D37可以支持入门级智能手机、平板电脑等成本较低的设备,获得2K级别的视觉效果与性能支持。) q: M/ v) I% F, L5 o2 x
1 `% J9 ~4 H: `# L U
2 N2 E* _: v' ^% p& P* e
Arm的通用型NPU能否获得成功?4 ?2 _! [9 V# o1 U( o
% J$ N7 Y' ^& j5 D8 V
( q+ o" o1 q0 h: u) ^0 ~
从目前的市场趋势来看,AI芯片正越来越向专用化的方向发展,越来越多的算法厂商也都纷纷基于自身的算法推出了自己的AI芯片。同样,正如前面我们所提到的,目前华为、苹果、高通、三星、展锐等众多的手机芯片厂商也都有推出自己的NPU内核。那么Arm的“通用型”的Ethos NPU IP真的有市场吗?
5 X( ]! M6 E1 C
0 G, h7 w1 s9 `: D% r: l+ A- ^: U, r) n7 W4 a! G4 a. z4 j
对此,Arm市场营销副总裁Ian Smythe表示,Arm的Ethos NPU IP并不是孤立存在的,其主要的优势在于,在其本身提供出色的AI性能的同时,可以更好与Arm的CPU、GPU进行协同,以实现异构的AI计算,从而进一步提升整个系统层级的AI性能、降低功耗。而且,目前AI市场还是在初期,很多的AI算法仍在快速迭代,选择“通用型”的NPU是比较安全的做法。' _: D2 O1 d% Z4 v
6 {, P, Y: s5 T0 q9 f$ S- O
' C0 n; m3 v; F1 o/ l
& p# G: ^& E: H( x% Z, ?" K
! J* n+ _9 C6 T! C6 h) x Y9 x/ I7 S8 k9 V
在采访当中,Ian Smythe向芯智讯确认,Arm的Ethos NPU IP也可被集成于比如RISC-V等其他架构的SoC当中,但是Ian Smythe也强调,这样并不能发挥出Ethos NPU与其它非Arm CPU/GPU在AI计算上的协同优势。
* m9 k/ O' g- N5 C6 d! _5 f( h" b1 @& o; w# t$ i; j
7 |1 P6 `5 `7 V$ a4 {
另外,Arm的Ethos NPU IP还实现了对于高中低阶的全面覆盖,但是目前众多的芯片厂商主要还是在其高端SoC当中集成了NPU,而随着AI计算向边缘侧部署的趋势,未来市场对于NPU的需求也将会越来越大。Ethos NPU IP的推出,将可帮助芯片设计厂商更简单、更低成本的获得不同档位的NPU内核的支持。$ f/ S6 w) t2 F4 O- b! }
& {) i! ]$ r. H4 R+ N" B8 U/ z1 C* g0 A G; U1 k! Q5 v8 L
另一方面,目前的Android应用生态基本都是基于Arm架构的处理器,因此,如果采用Arm的Ethos NPU IP,结合开源的Arm NN框架,应用开发者将可以更简单、高效的调用Arm的CPU/GPU/NPU内核,可以为用户带来更为出色的AI体验。而且,可以实现一次开发,即可获得Arm全系列的内核的支持(这也意味着,可支持众多基于Arm不同类型的内核的SoC),无需再重新编译。而对于其他的芯片厂商的NPU来说,开发者要想实现灵活高效的调用NPU,充分发挥其AI性能,则需要针对性的进行优化,而且还需要其提供相应的权限和工具。即便是开发者开发应用实现对于A厂商的NPU调用,同样的应用要想实现对于B厂商NPU的调用,可能需要重新进行编译。显然,对于应用开发者来说,Arm的NPU所具备的生态优势无疑是其他厂商所无法比拟的。- x o" `6 T3 n" ] v
3 g. f6 T8 {0 q* t
) E; A ?2 L/ q最后,Ian Smythe强调,Arm对于AI性能的提升是多维度的,一方面会持续推出更高性能的NPU IP,同时也在不断提升Arm CPU/GPU的AI性能。
) e/ B; I% Q7 @/ e6 B0 g( Q1 \) k
$ R5 n u1 t$ z4 U! Z/ k* v: u
8 I" Y" {! w6 t+ Z* A C$ e( e; x
, e1 p% f9 B) E+ r
. f9 O& P" ]% d8 \值得一提的是,Ian Smythe在演讲当中透露,Arm在下下一代的大核架构Matterhorn当中,加入Matrix Multiple(MatMul),令其ML(机器学习)性能与前代CPU相比提升一倍。
# k/ q2 [+ D9 g: T! X, n O% h$ c& a7 g( \5 m
$ {! ^6 P0 k; t编辑:芯智讯-浪客剑1 A9 s6 u/ i) z# _
往期精彩文章
9 v1 B8 k# ~! m0 S4 V& NVR市场迎来第二春:5G+VR云化将成最大推力!: c/ q. |8 b( p$ z# w3 J
6 X9 R. ?8 r. g$ _4 Z( H2019生物识别论坛成功落幕:这十大看点不容错过!
# ~& P- d3 J- C" _2 b" B. d( m阿里平头哥正式开源RISC-V架构MCU芯片平台
* T3 V" z: q& {1 R' ^首度杀入3D人脸识别门锁/门禁市场,英特尔为何选择与小钴科技结盟?3 o3 f% N# i; t! }: \
& }6 o( Q0 K1 V6 f
展锐再推4G功能机芯片虎贲T117,意义何在?% D, N- R/ W3 \: D. Y
% N/ `# E1 K& {历史首次!华为海思4G芯片Balong 711对外销售!
. r b6 a2 l* c, s) J( L
' R6 K; T% }) d+ w( s不惧美国打压!华为已获得65份5G商用合同,5G基站发货超40万个!
. I( Z" {3 u2 v# P% Y% I, J* G- v" Y+ R
巨额债务违约+资金链断裂?手机ODM厂商海派关厂裁员!; p) C5 E2 c* d0 L; ^3 F4 e
: n, e' D' v( V6 i5 [ e2 u2 m4 G可穿戴巨头Fitbit宣布撤出中国!% G0 J9 [$ U' ]( c
6 i% Q6 g8 p- L+ A9 D+ I: b3 f收购Intel基带芯片业务涉嫌违规?苹果遭市监总局启动问询# G- S4 {' T, V7 w* i7 u
d; h; f7 ^% I# X3 G1 N2 ~
禁令之下,安防巨头海康与大华的应对之策!1 u3 F8 w# a; p. C' L
; o* i5 r# Y9 H# \为应对RISC-V挑战?Arm CPU引入自定义指令功能!8 Q- ^! z5 g5 K! u5 z2 F6 }/ W2 s+ I
行业交流、合作请加微信:icsmart01
4 I1 [, n! j: B" G3 f芯智讯官方交流群:221807116
8 k4 c7 [) y* Z1 x3 f" J' @! y) M5 z; \9 t
来源:http://mp.weixin.qq.com/s?src=11×tamp=1572103805&ver=1936&signature=jeCKwe1UBQzC*Pzs8GoY9TZBvEs1rdMAvR4c22h3Cpdg-qQ*TOrpE2uZ4YvRMx7pQMFu5Q-as9lkvJgPIZqWm1WA-*ncmgAC2Ls6p79VafFsjOW9cM78m6hG7c-lzR2Q&new=1
3 m# R4 p: m! S8 a- Y$ X免责声明:如果侵犯了您的权益,请联系站长,我们会及时删除侵权内容,谢谢合作! |
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有账号?立即注册
×
|