奋斗

小米玄戒O100推倒内存墙:实现真正的近存计算_我的网站

千王之王

A |     8月24日消息,今天下午,小米除了发布玄戒O3之外,还带来了玄戒O100,一款大模型专用的AI加速芯片,更是全球首款6nm 3D晶圆级堆叠的AI加速芯片。

B |     咬定目标 争先进位            抚顺日报评论员            “遵道而行,但到半途须努力;会心不远,要登绝顶莫辞劳。”10月24日,市委常委会(扩大)会议暨抚顺市全面振兴新突破三年行动领导小组争先进位工作部署会议召开。    玄戒O100通过先进的3D堆叠工艺,实现了1.22TB/s的超高带宽,这一速度是目前主流旗舰手机的16倍之多,可以让移动端设备的AI性能实现质的突破。

C | 玄戒O100与玄戒O3是AI终端的“最佳CP”,最高可以实现本地AI推理速度高达330Tokens/s。距离年底不足70天,时间不等人、任务不等人、机遇不等人。     传统计算架构下,计算单元与存储单元物理分离,数据必须在两者之间反复搬运。在此时点高规格召开争先进位工作部署会议用意深远,就是要统一全市上下的思想和意志,保持定力、持续用力、全面加力,竭力推动各项工作争先进位。           “的必先立,然后挟弓注矢以从之。

D | ”凡事都要确立一个清晰可达的目标才行。

E | 冲刺四季度不是泛泛的号召,该往哪个方向冲、冲到什么程度,我们必须心中有数。本次会议上明确提出,全年地区生产总值增长达5.4%以上,实现经济总量过千亿。但内存数据通路受限于物理引脚数量,遇到了增长瓶颈。    当AI算力以指数级增长时,内存访问速度与算力之间已经严重脱节,成为性能的关键阻碍,业界称之为“内存墙”。玄戒O100,则是小米“推倒内存墙”的破局之法。     区别于以往晶圆→切割为裸片(Die)→逐片封装互联的方式,玄戒O100采用先进的Wafer on Wafer封装技术,也就是将多片完整的晶圆直接高精度对准与键合,继而再切割成独立的3D芯片。这是我们四季度为之冲刺的“硬指标”,也是我们向省委立下的“军令状”、向全市人民作出的“承诺书”。

F |     这彻底摆脱了传统引脚数量对带宽的物理限制,将数据通路从“平面走线”变为“垂直穿透”,实现真正的近存计算(Near-Memory Computing)。         了解大体逻辑后,我们看看玄戒O100到底如何做的。首先将两层AI专用高速DRAM晶圆与一层高性能NPU晶圆垂直堆叠,然后在垂直方向“钻隧道”让数据可以高速流转。

G | 就全市当前面临的发展形势和发展机遇而言,这既是一个有实现难度的“高标线”,也是我们必须实现的“保底线”。    所以,只要隧道越多,也就可以实现越高的带宽。           有风有雨是常态,风雨无阻是心态,风雨兼程是状态。为此,玄戒O100采用了先进的Hybrid Bonding混合键合工艺,摒弃了传统微凸点(Micro Bump)结构,直接将物理通路的间隔缩短至1.4μm,让数据通路密度大幅提升。在四季度这一关键点、吃劲时,我们咬紧牙、绷住弦、铆足劲,坚持干字当头、拼抢争实,攻坚克难、全力冲刺,就有奋起直追、迎头赶上的希望。              为了进一步缩短DRAM与NPU计算层的物理距离,玄戒O100还采用了 Face to Face(简称F2F)金属层直连结构。我们要积极向上争取,抢抓政策机遇,把政策红利转化为发展红利;强化项目建设,大力招商引资,持续扩大有效投资;牢牢扭住创新这个“牛鼻子”,不断推动三次产业协同发展,扎实做好结构调整“三篇大文章”,因地制宜发展新质生产力;进一步优化营商环境,多措并举解决企业发展难题;用心用情办好民生实事,坚定不移守住安全底线,坚决打赢攻坚之年攻坚之战,也为明年工作起好步、开好头奠定坚实基础。           决战四季度、决胜攻坚战,处处都有硬骨头,场场都是歼灭战。

H |     简单来说,每一层晶圆内部,其实底部是逻辑晶体管,上层有密布多层的金属走线层。全市上下必须迅速行动起来,以“等不起”的紧迫感、“慢不得”的危机感、“坐不住”的责任感,以“咬定青山不放松”的韧劲、“不破楼兰终不还”的拼劲、“踏平坎坷成大道”的干劲,对标目标任务,找准进的方向,聚焦问题、靶向发力、精准施策,坚决攻下“难关”、拿下“硬仗”。F2F,就是让DRAM与NPU的金属走线“面面相对”,如此可以实现更短的物理互联距离,实现更快的信号传输。

I |     当然,这说起来简单,在6nm如此高工艺节点下,要解决散热、电磁干扰等诸多难题,玄戒团队逐一攻坚,实现最终量产,并申请了15项专利,其中已获批4项发明专利。各级领导干部要以上率下,当好执行者、行动派、实干家,一级做给一级看、一级带着一级干,引导广大党员干部群众心往一处想、劲往一处使,全力拼速度、比力度、强进度,持续推动各项工作提速提质提效,以最大努力争取最好结果。           大干必有成果,奋斗就有回报。         与此同时,玄戒O100配备了14颗高算力NPU,通过玄戒高带宽矩阵总线,让数据可以在NPU与内存、与其他NPU核心之间等高速流转。     创新的矩阵总线支持拓扑动态切换,Prefill阶段采用环形拓扑,数据逐核流转、顺序同步;Decode阶段切换为广播拓扑,所有结果统一汇聚到指定核心。只要我们始终保持进取的姿态、奋进的状态,敢闯敢干加实干,就一定能踢好“临门一脚”,跑好“最后一棒”,向全市人民交出一份满意答卷。

J | 总线控制上的灵活拓扑,让片上计算资源得以充分应用。         最终,玄戒O100的带宽达到了惊人的1.22TB/s。大家对这个数字可能没什么概念,以目前主流旗舰手机LPDDR5X内存作为对比,它的带宽76.8GB/s,而玄戒O100是其16倍之多,彻底释放端侧AI性能。                    责任编辑:李丹。         为了验证玄戒O100的高带宽表现,小米工程师还做了一款原型机,搭载玄戒O3和O100,双芯协同计算。小米还引入了风冷主动散热,充分发挥芯片的全部性能。配合Xiaomi MiMo端侧模型,实现了超高速端侧推理性能。                   

     【本文结束】如需转载请务必注明出处:      责任编辑:振亭     文章内容举报     

Current article:http://xk4o.diuhuairandaikaomangshangnen.buzz/list_ftk/tkqos5.html

Published on:00:00:00


我的网站最近更新

我的网站热门资讯