仅有13 TOPS!英特尔桌面NPU难撑本地AI大梁:够不到Copilot+门槛

倚天百科 百科资讯 3

9月21日消息,随着酷睿Ultra 200S系列的推出,英特尔首次将NPU集成到面向发烧友的传统桌面处理器中。

这一举措标志着传统桌面PC正式进入了具备底层AI硬件加速的时代,旗舰型号酷睿Ultra 9 285K成为了首批搭载该技术的代表性产品。

在具体规格上,酷睿Ultra 9 285K除了拥有8个性能核和16个能效核外,还额外集成了两个神经网络计算引擎模块,这两个模块包含4096个乘加单元以及4MB的本地内存,支持INT8和FP16推理。

根据官方数据,该NPU的单体算力为13 TOPS,如果结合CPU和核显的算力,整机平台的AI总算力最高可达36 TOPS。

NPU的定位是高能效推理:它可以承担较小的AI工作负载,同时让CPU和GPU腾出手来处理其他任务。这也是它与大尺寸显卡的本质区别,一块配备Tensor核心的GeForce显卡在多数情况下能更快地处理合适的模型,但功耗也高得多。

所以说NPU的目标不是击败GPU,而是接手那些可以并行执行、且需要尽可能高效完成的任务。

技术实现层面,英特尔为NPU配备了独立的驱动栈,将其作为深度学习加速器,以独立计算设备的身份呈现给操作系统。

NPU内部的调度器会把任务分配到两个NCE Tile上,OpenVINO则可通过专属插件将NPU设为推理目标,例如让NPU承担模型的本体计算,而CPU或GPU继续服务其他工作负载。

不过13 TOPS的算力放在当下确实偏低,要知道微软对Copilot+ PC的定义之一就是NPU性能超过40 TOPS,而Core Ultra 9 285K的NPU只有13 TOPS。这意味着Arrow Lake-S虽拥有专用AI单元,却够不到微软众多重点宣传的本地AI功能所要求的性能门槛。

这也解释了桌面NPU至今存在感稀薄的原因:它确实存在、系统能识别、技术上也可以调用,但实际利用完全取决于软件,开发者必须显支持相应的后端或运行时环境,例如通过OpenVINO及英特尔提供的NPU插件完成模型的编译与执行。

那么NPU在桌面端何时真正有用?主要是那些经常发生、或与其他工作负载并行的小型推理任务,典型场景包括视频会议中的降噪与背景特效、语音与图像识别,以及图像、音频软件中的本地滤镜。

此类任务通常由相对较小的模型反复执行矩阵运算,非常适合卸载到专用NPU上,在优化得当的程序中,不同任务可以同时分发到各自最合适的计算单元。

但对一台游戏PC而言,目前能从中受益的场景仍然寥寥,更何况应用程序必须显式支持NPU,缺少相应后端时,工作负载依然会落在CPU和GPU上。