关键词: 麒麟9050 Pro 逻辑折叠 双Die堆叠 华为SoC
近日,半导体分析机构Kurnal Insights发布了华为麒麟9050 Pro(Hisilicon Hi36E0)芯片的裸片照片(Die Shot),首次从物理层面清晰展示了这款基于华为“韬定律”逻辑折叠(LogicFolding)技术的全新SoC的内部结构。

裸片照片显示,麒麟9050 Pro并未采用传统的将计算单元与SRAM集成在同一个2D裸片上的设计,而是由两颗尺寸完全相同的裸片垂直堆叠而成:一颗计算Die(CPU、GPU、NPU、ISP、DSP等计算单元均在该层),一颗SRAM Die(SRAM与各级缓存集中在该层)。两颗裸片尺寸均为11.13mm×10.84mm,面积约120.65mm²——单颗面积甚至略小于前代麒麟9030S的122mm²。

两颗裸片通过“逻辑折叠”技术键合,以低至微米级间距的垂直互连缩短信号链路,使两个Die在功能上作为一个单片单元运行。据华为半导体业务负责人何庭波此前论文的阐述,逻辑折叠并非传统意义上的封装堆叠,而是将原本在平面上展开的完整逻辑系统放到三维空间中重新设计、重新布线、重新定义时序。
工艺方面,据爆料人@Taog_1575透露,计算Die采用中芯国际N+3工艺,SRAM Die采用N+2工艺,这种不同工艺节点的组合在麒麟芯片中尚属首次。需要说明的是,该工艺信息来自爆料,华为官方尚未证实。
密度提升是这次架构创新的核心收益。据Bernstein研报估算,麒麟9050 Pro的等效晶体管密度达到每平方毫米2.38亿个,较上一代麒麟9030 Pro的约1.55亿个提升超过50%。何庭波论文给出的数据同样是2.38亿颗/mm²、提升55%;而华为发布会披露,若只看计算Die的逻辑单元晶体管密度,提升幅度约为28%。

此外,逻辑折叠架构压缩了关键路径时延:时钟缓冲器数量降低55%,关键路径时延减少30%;两颗Die之间实现了500万个信号传输键合,跨Die传输带宽高达125TB/秒。
性能方面,根据华为官方数据,麒麟9050 Pro相比上代麒麟9030 Pro,CPU多核性能提升23%,GPU图形渲染性能提升40%,NPU性能提升140%、可在端侧运行30B MOE大模型;集成的第十代ISP将长焦清晰度提升34%,巴龙基带支持超5.5G通信。
从Kurnal公布的标注图看,计算Die集成了:6核Maleoon 955 GPU(主频1056MHz);自研灵犀9核16线程CPU,采用1+6+2架构(1个3.1GHz大核、6个2.2GHz中核、2个1.75GHz小核);4核达芬奇NPU;配备专用双核CPU的Kirin ISP;DSP/Display单元以及巴龙5G基带。
SRAM Die则不是一片简单的“缓存仓库”,而是与计算Die高度对应的有源多级缓存层:GPU配有4MB共享二级缓存,CPU大核有独立3MB二级缓存、5核集群共享8MB三级缓存,NPU每核配1MB缓存,另有12MB系统级缓存(SLC)供全SoC调用。分析指出,计算单元与缓存之间构成的跨硅层逻辑-存储垂直耦合关系,比单纯的计算Die与DRAM堆叠更加复杂。

裸片照的曝光首次从物理层面证实了华为以架构创新而非单纯制程微缩提升芯片性能的可行路线。有外媒报道称,其效能表现已大致相当于台积电或英特尔先进工艺中的3nm级别;也有国外机构报告指出,麒麟9050 Pro已把国产移动旗舰芯片与苹果同级别产品的技术差距,从上一代的大约四年缩小到三年左右。
但这一方案并非没有代价。两颗Die稳定协同工作,必须依赖高精度晶圆减薄、混合键合(Hybrid Bonding)以及极高精度的对准与互连工艺;在“逻辑Die+SRAM Die+键合”的架构下,任一环节出现问题都可能拖累最终封装良率,甚至导致两颗Die同时报废。目前该芯片仅搭载于Mate90 Pro Max及以上定位的旗舰机型,有分析认为双层裸片堆叠的复杂工序意味着整体封装良率可能仍处于爬坡阶段,良率与散热控制仍是这类3D堆叠技术走向大规模量产需要持续攻坚的工程挑战。
来源:电子工程专辑