瘾潮流 首页 科技 查看内容

高通详解下一代骁龙旗舰 NPU 升级:更强 AI 推理能力将降低对内存的依赖

2026-9-11 16:19| 发布者: Mic| 查看: 6| 评论: 0


高通近日进一步公布了骁龙8 Elite Gen 6 Pro的AI处理能力细节,其中最值得关注的是全新Hexagon NPU的升级。与过去单纯追求AI算力增长不同,高通此次更加重视AI模型运行效率、内存访问以及功耗控制,希望让下一代旗舰手机能够在本地运行规模更大的生成式AI模型和AI智能体。

高通表示,随着生成式AI逐渐成为智能手机的重要功能,AI模型本身也在不断变得更加庞大和复杂。对于移动设备而言,真正的瓶颈已经不只是计算能力,而是如何在有限的功耗和内存带宽条件下高效处理这些模型。因此,骁龙8 Elite Gen 6 Pro的NPU进行了多方面重新设计。

其中一项重要升级是新增Element Accelerator(元素加速器)。这一专用硬件加速单元针对AI计算中的特定操作进行优化,可以提高NPU执行相关工作负载时的效率。与单纯提高NPU峰值算力相比,这种专用化设计能够让芯片以更少的资源完成特定AI任务,从而降低计算过程中的能耗。

新一代Hexagon NPU还获得了规模更大的共享内存。高通表示,其Large Shared Memory容量相比上一代增加了50%。这部分高速共享内存可以让NPU更加方便地保存AI模型运行过程中所需要的数据,从而减少频繁访问系统内存的需求。

这一变化对于大语言模型尤其重要。在运行生成式AI时,模型需要不断处理大量上下文数据,而其中一部分数据必须在推理过程中持续保留。如果这些数据频繁在NPU与系统内存之间来回传输,就会增加延迟,同时消耗更多电力。通过增加NPU内部可以直接使用的高速共享内存,高通希望尽可能减少这种数据搬运。

其中一个受益明显的对象就是KV Cache。随着用户与AI助手进行越来越长的连续对话,模型需要保存越来越多的上下文信息。KV Cache规模也会随之增加,而它往往会成为本地运行大模型时的重要内存负担。更大的共享内存能够让更多相关数据留在距离计算单元更近的位置,从而改善AI推理效率。

高通认为,这种能力对于AI智能体尤其重要。与传统的问答式AI相比,AI智能体需要连续完成多个步骤,例如理解用户需求、制定执行计划、调用不同工具、分析返回结果,再继续执行下一步操作。在整个过程中,模型状态和上下文需要持续保存,因此减少内存访问能够帮助降低延迟,让复杂的AI任务运行得更加顺畅。

高通此次对NPU的改进也意味着,未来手机运行AI时并不一定需要单纯依靠增加系统RAM来解决问题。随着本地AI模型越来越大,手机厂商近年来不断提高旗舰产品的内存容量,但增加RAM不仅会提高硬件成本,也会增加功耗以及内存供应方面的压力。通过把更多数据放入芯片内部的高速共享内存,高通试图从架构层面缓解这一问题。

除了NPU之外,骁龙8 Elite Gen 6 Pro的CPU和GPU也进行了明显升级。高通此前已经透露,新一代旗舰平台将拥有最高达到5GHz的CPU频率。如果这一规格最终按照目前公布的信息落地,它将成为移动处理器中一个非常具有象征意义的节点,因为智能手机CPU的最高频率将正式跨入5GHz时代。

高通还为CPU引入了FlexCache技术。其核心思路同样是减少处理器对外部系统内存的依赖,通过更加灵活地利用芯片内部缓存,让CPU能够更高效地获取数据。对于现代移动处理器而言,缓存和内存之间的数据访问效率已经越来越重要,因此这种设计能够在一定程度上改善性能和能效之间的平衡。

GPU方面同样出现了大幅度的架构变化。高通将新一代Adreno GPU描述为一次非常重要的架构升级,并不仅仅针对传统图形性能进行改进,还进一步强化了GPU执行AI任务的能力。

其中一项重要变化是加入Adreno Matrix Cores,也就是专门用于矩阵计算的核心。矩阵运算是现代AI模型中的重要计算类型,因此专用矩阵核心能够帮助GPU更加高效地执行AI相关工作。

这意味着未来的骁龙旗舰平台并不会把所有AI计算都交给NPU。根据具体任务的不同,CPU、GPU和NPU可以各自承担不同类型的工作,从而形成更加明显的异构计算体系。对于游戏而言,GPU可以在完成传统图形渲染的同时承担部分AI计算;而对于生成式AI等工作负载,NPU则可以发挥更加主要的作用。

高通还推出了Adreno Neural Fusion技术,用于进一步强化AI与图形渲染之间的结合。这项技术可以利用AI算法改善游戏画面的视觉效果,并帮助实现更加先进的图形处理效果,同时控制功耗。

这种设计尤其适合超分辨率和帧生成等近年来快速发展的AI图形技术。手机游戏的分辨率和画面复杂程度不断提高,如果所有画面都依靠传统方式进行原生渲染,GPU负担和功耗都会迅速增加。利用AI生成部分画面信息,可以在较低渲染成本下获得更高的最终画面质量。

从整体架构来看,骁龙8 Elite Gen 6 Pro的AI升级并不是简单地把NPU做得更快,而是试图重新设计整个SoC内部的数据处理方式。NPU拥有更大的共享内存和专用加速器,CPU通过FlexCache减少对系统内存的依赖,GPU则增加专门的矩阵计算能力,并通过AI技术参与图形处理。

这种变化反映出移动芯片正在进入一个新的阶段。过去衡量旗舰SoC性能时,人们主要关注CPU和GPU跑分,而如今AI工作负载已经成为决定芯片实际体验的重要因素。对于下一代手机而言,真正重要的不仅是芯片能够达到多高的峰值算力,还包括能否在有限功耗下长时间运行AI模型,以及能否有效控制数据在不同计算单元和内存之间的移动。

高通此次特别强调共享内存和减少内存访问,也说明AI时代的芯片竞争正在逐渐从单纯的“算力大战”转向“数据搬运效率大战”。对于大型AI模型而言,计算本身固然重要,但如何把模型参数、上下文以及中间结果及时送到正确的计算单元,同样会直接影响最终性能和能耗。

因此,骁龙8 Elite Gen 6 Pro真正值得关注的地方,可能并不是单项AI性能提高了多少,而是高通正在尝试通过NPU、CPU、GPU、缓存和共享内存之间更加紧密的协同,让手机能够在本地处理越来越复杂的AI任务。

随着AI助手、AI智能体、生成式应用以及AI游戏功能逐渐成为旗舰手机的重要组成部分,这种架构思路也可能成为未来移动SoC发展的重要方向。相比不断增加系统RAM,通过芯片内部更高效的数据处理和缓存机制来消化不断膨胀的AI模型,有望在性能、功耗和成本之间取得更加合理的平衡。

骁龙8 Elite Gen 6 Pro最终能否兑现这些技术目标,还需要等到实际设备上市后通过完整测试来验证。不过从目前公布的信息来看,高通这一代旗舰平台的升级重点已经非常明确:不仅要让AI计算更快,还要让AI计算更加高效,并尽可能减少手机为了运行本地AI而付出的内存和功耗代价。 

路过

雷人

握手

鲜花

鸡蛋

相关阅读

最新评论

关注公众号
Archiver|手机版|瘾潮流

相关侵权、举报、投诉及建议等,请发 E-mail:admin@discuz.vip

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|闽ICP备05025429号

关注公众号
返回顶部