Lazy loaded image
向大脑学习:双通路脉冲神经网络实现4倍吞吐量、5倍能效提升
字数 1446阅读时长≈ 4 分钟
2026-6-24
2026-8-10
人脑以约20瓦的功耗处理着海量信息,而当前的AI系统动辄消耗数兆瓦电力。这个巨大的效率差距,一直是神经形态计算领域追求的目标。最近,帝国理工学院和苏黎世联邦理工学院的研究团队在《Nature Machine Intelligence》上发表了一项突破性成果——他们从大脑皮层的快慢神经通路中汲取灵感,设计出一种全新的脉冲神经网络架构,在吞吐量和能效上分别实现了4倍和5倍的飞跃。

脉冲神经网络的困境

脉冲神经网络(Spiking Neural Networks, SNNs)是受生物神经元通信方式启发的AI模型。与传统神经网络持续处理信息不同,SNNs只在检测到有意义的变化时才产生脉冲信号,这种「事件驱动」的特性使其天然具备低功耗的优势。
然而,SNNs一直面临一个核心矛盾:如何在保持事件驱动高效性的同时,长时间保留有用的任务相关信息。标准的漏积分发放(Leaky Integrate-and-Fire)神经元只能在毫秒级时间尺度上保持信息,而需要处理长序列数据的任务——比如语音识别、视频分析——则要求模型具备更强的「长期记忆」能力。
过去的研究尝试了两种路径:一是引入密集的递归连接,但这会破坏脉冲的稀疏性优势,增加内存和能耗;二是使用可学习的轴突延迟,但这需要深度缓冲区和逐连接的时序元数据,在硬件实现上代价高昂。两条路都走到了「时间能力」与「硬件效率」的死胡同。

大脑皮层的启示:快慢双通路

研究团队从哺乳动物大脑皮层中找到了答案。皮层电路通过树突分支整合不同时间尺度的输入信号,同时神经元群体具有异质的时间常数,共同塑造快速的胞体脉冲活动——而这一切不需要密集的全局递归连接。
受此启发,团队提出了「双通路脉冲神经网络」(Dual Memory Pathway SNN, DMP-SNN)架构。其核心思想是:在每一层中维护一个紧凑的低维「慢记忆状态」,用于总结近期活动并调节脉冲动态,同时保留快速的脉冲活动通路。这就像大脑中慢速的树突整合与快速的胞体脉冲并行工作一样。
这种显式记忆机制稳定了学习过程,同时保留了事件驱动的稀疏性。在长序列基准测试中,DMP-SNN以比同类最先进SNN少40-60%的参数量,达到了相当的精度水平。

软硬件协同设计的关键突破

这项研究的另一大亮点是算法与硬件的协同设计。团队不仅优化了算法,还专门设计了适配DMP-SNN的近存计算(near-memory-compute)硬件架构。
硬件层面的核心创新包括:首先,通过打破计算依赖关系,将慢记忆更新与记忆积分操作并行化,消除了吞吐量瓶颈;其次,采用细粒度的算子融合技术,将漏积分更新、脉冲积分和记忆积分合并为单一过程,将每个神经元的内存访问从至少两次降低到仅一次;第三,针对稀疏脉冲积分和密集向量-矩阵乘法分别采用异质的操作数驻留策略,进一步提升算术强度。
在与Intel Loihi 2、ReckOn、ElfCore和DenRAM等领先神经形态硬件平台的对比测试中,DMP-SNN的表现令人瞩目:吞吐量比Loihi 2上的延迟实现方案高出4倍以上,比ReckOn等递归架构高出1.9倍;能效比Loihi 2和DenRAM高出5倍以上;面积效率比ReckOn高出2倍。

从实验室到边缘计算

这项研究的意义远不止于学术指标的提升。DMP-SNN的高效特性使其特别适合部署在资源受限的边缘设备上。论文指出,该架构可应用于机器人技术、可穿戴设备、边缘AI以及多传感器网络等场景——这些恰好是当前AI落地最热门也最具挑战性的领域。
更值得关注的是,研究团队证明了「时间能力」与「硬件效率」之间的矛盾并非不可调和。通过将时间上下文设计为显式的、紧凑的、层局部的状态,长程处理可以与硬件效率共存,而非相互竞争。这一发现为未来的神经形态芯片设计开辟了新的范式。

💡
当AI行业还在比拼谁的模型更大、参数更多时,这项研究提醒我们:向大脑学习「如何用更少做更多」,或许才是通向通用人工智能的更优雅路径。从皮层的快慢通路到芯片上的并行架构,生物原理正在为计算效率写下新的定义。
上一篇
SandboxAQ获美国商务部5亿美元CHIPS法案资助:用AI重新定义半导体材料发现
下一篇
NVIDIA发布Halos:人形机器人首个全栈安全系统,物理AI落地再进一步