您当前的位置:
科研动态

实验室关于视觉基础模型参数高效微调的工作被T-PAMI接收

发布时间: 2026-09-10

近日,实验室关于视觉基础模型参数高效微调的工作“Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models”(作者:申树藩,孙隽姝,王树徽,黄庆明)被T-PAMI接收。T-PAMI全称为IEEE Transactions on Pattern Analysis and Machine Intelligence,是模式识别、计算机视觉及机器学习领域的主流国际期刊, 2026年公布的影响因子为20.4

近年来,参数高效微调已成为将预训练视觉模型适配到下游任务的重要技术,其中稀疏微调通过仅更新少量任务相关权重,在降低计算与过拟合风险的同时取得了良好的任务适应能力。然而,现有稀疏微调方法通常采用“先定位、后微调”的两阶段范式,不仅依赖静态梯度信息定位任务相关权重,忽略了微调过程中参数的动态演化,而且仍需在优化器中存储完整权重矩阵,导致较高的内存开销。为此,本研究提出了一种端到端的稀疏微调框架 SNELLASparse tuning with kerNELized LoRA and Adaptive bi-level sparsity allocation,在低内存开销下实现任务相关权重的动态定位与更新。具体而言,我们首先从核方法视角扩展 LoRA,通过非线性核函数将低秩矩阵映射并融合为高秩更新矩阵,从而突破传统 LoRA 的低秩约束对权重独立调整能力的限制。进一步地,我们针对现有非线性核函数存在的表达能力与训练稳定性权衡,提出 Mix-K核函数,通过结合归一化 RBF 核与分段线性核,在提升低秩可学习模块表达能力的同时有效缓解梯度消失问题。为了更准确地定位任务相关权重,我们进一步提出自适应双层稀疏分配机制通过层间与层内的动态竞争,自适应地将有限的参数预算分配至更重要的层和权重,实现稀疏参数的端到端定位与更新。大量实验表明,SNELLA 在图像分类、医学图像分割和文本到图像生成等多种任务上均取得了优于现有方法的性能。例如,在 FGVC 基准上,相较于 SPT-LoRA 平均 Top-1 准确率提升 1.8%91.9% vs. 90.1%,同时在不同规模模型上实现 31.1%–39.9% 的内存降低,展现出良好的性能与内存效率。


附件: