← 返回首页

LAKD:基于局部学习的激活映射蒸馏

2026-08-30 · 机器学习 · #知识蒸馏 · #模型压缩 · #计算机视觉

LAKD:基于局部学习的激活映射蒸馏

今天分享一篇知识蒸馏方向的新论文:LAKD: Activation Mapping Distillation Based on Local Learning(Local Attention Knowledge Distillation)。

知识蒸馏(Knowledge Distillation)在各类基础视觉模型中被广泛使用,核心目标是让紧凑的学生模型(compact model)从大模型教师(teacher)那里学到知识,从而在参数量小得多的前提下逼近教师的表现。

现有方法的痛点

已有的蒸馏方法大多把精力花在设计不同的蒸馏目标上——比如匹配教师输出的 logits、中间层特征、注意力图等等,想尽办法从教师那里"挖"出知识给学生。

但这类方法普遍忽略了一个问题:蒸馏信息的有效利用

换句话说,蒸馏在实践里效果好,但像个黑盒——你只知道"有用",不知道"为什么有用"。

LAKD 的核心思路:分离-解耦 + 非方向性激活映射

LAKD 提出一个全新的蒸馏框架,目标是更高效地利用蒸馏信息,同时获得更高的可解释性。它通过分离-解耦机制(separation-decoupling)非方向性激活映射(non-directional activation mapping),建立了一个独立的交互训练机制。

1. 分离-解耦:把学生网络切成局部模块

关键设计:把学生网络划分成多个具有独立梯度的局部模块,从而把教师传递过来的知识"解耦"开。

传统蒸馏是"一个学生整体去模仿一个教师",所有层的误差通过整个网络反向传播,信息混在一起。LAKD 则让每个局部模块独立地、渐进地学习——从简单到复杂,逐步交互训练,让不同模块各学各的,互不干扰。

2. 非方向性激活映射:整合局部知识

解耦之后还要能"合起来"。LAKD 用非方向性激活映射,帮助学生网络通过学习粗粒度的特征知识,把来自不同局部模块的知识整合起来。

这样既保留了局部解耦带来的清晰分工,又通过粗粒度映射让学生有一个全局的整合视角,而不是各模块各玩各的。

实验结果

CIFAR-10、CIFAR-100 和 ImageNet 三个数据集上,LAKD 显著优于现有方法,一致地达到 SOTA。

值得注意的点是:它不仅在精度上领先,而且因为有了"分离-解耦"的结构,整个蒸馏过程变得可解释——你能说清楚教师的知识是如何一步步传递并帮助学生学习的,这是很多蒸馏方法给不了的。

一些思考

蒸馏领域这几年卷的方向大多是"换一个更好的蒸馏目标",而 LAKD 换了个角度:信息利用效率 + 可解释性。把学生网络拆成独立梯度模块这个思路,和 RAG 里"知识解耦、结构化利用"的思想有些异曲同工——都是"别再一股脑塞,拆开、理清、再整合"。

当然,局部模块的划分方式(分几块、怎么分)应该对效果有影响,论文里值得细看;另外独立梯度模块会不会增加训练成本,也是实际部署时需要考虑的。

参考

本文由 RaZz 发布 · Struggle for Better · 返回首页