2026年7月,实验室3篇论文被ACM MM 2026接收。ACM MM会议的全称是ACM International Conference on Multimedia,是多媒体领域的顶级会议。会议将于2026年11月10日至11月14日在巴西里约热内卢召开。
被录用论文的简要介绍如下:
1. DishSeg24k: A Large-Scale Benchmark for Food Segmentation with Stochastic Expert Decoding (Yilin Wang, Haochen Shi, Guanyu Chen, Weiqing Min, Jinkai Zheng, Chenggang Yan, Shuqiang Jiang)
食物图像分割是智能餐饮、膳食评估和个性化推荐等应用中的关键技术。然而现有分割方法无法应对真实用餐场景中菜品密集重叠、外观高度相似以及长尾类别分布等挑战。为此,本研究首先面向真实世界用餐环境,构建了一个大规模菜品图像分割数据集DishSeg24k,包含24,096张图像、112,281个实例标注和278个菜品类别。基于 DishSeg24k数据集,本研究进一步提出了食物专家自适应分割(Food Expert Adaptive Segmentation Transformers,FEAST) 方法。FEAST方法将基于查询的解码过程建模为一个马尔可夫决策过程,其中每个解码器层的更新都被视为一个顺序决策步骤,用于探索菜品间边界的不确定性;为使模型具备学习多种菜品的细微纹理的能力,进一步引入强化学习引导的混合专家网络重新设计了解码器。最终,利用双评论家解耦优化方案将面向任务的查询优化与结构感知的专家路由分离开来,从而使专家分工更加明确,并防止长尾类别分布下的专家崩溃。最后,在DishSeg24k数据集上的大量实验表明,FEAST达到了当前最优性能,相比当前基线方法, mIoU、mDice和mAcc分别高出3.21%、3.68%和4.00%。在FoodSeg103数据集上的评估进一步验证了FEAST的有效性。

2. VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task (Xingming Long, Jie Zhang, Shiguang Shan, Xilin Chen)
视觉语言大模型(LVLMs)的幻觉研究大都集中在事实描述任务上,这些任务要求模型尽量忠实地描述图像内容。然而,很少有研究关注主动想象任务(如故事创作)中的幻觉问题。为此,我们提出了主动想象存在估计测评方法(Voluntary-imagined Object Presence Evaluation, VOPE)。具体而言,VOPE 基于LVLM主动想象的内容,设计存在性判断问题来评估模型对于自身生成内容的认知正确性,并以此识别主动想象幻觉。我们将 VOPE 应用于多种主流的LVLM,并得出了两个关键发现:1、大多数LVLM在主动想象过程中会出现严重的幻觉,且它们在针对自身想象内容的存在性评估中表现较差;2、现有幻觉消减方法在解决主动想象幻觉时效果有限,如何解决这一问题是未来研究的一个重要方向。
【论文链接】https://arxiv.org/abs/2511.13420

3. When 1+1 Backfires: Rethinking Relevance-Diversity Balancing for Sample-Aware Visual Token Reduction (Yihang Huang, Peisong Wen, Chenhao Zhou, Difu Feng, Qianqian Xu)
视觉词元压缩是降低大型视觉语言模型(LVLM)推理开销的重要手段。现有方法通常依据文本相关性或视觉多样性筛选词元,或以固定方式结合两者,默认所有输入具有相同的相关性—多样性需求。然而,本文通过系统分析发现,二者的最优平衡不仅在不同任务之间存在明显差异,在同一任务的不同样本之间也会发生显著变化。这表明,简单结合相关性与多样性并不一定带来更好的效果,视觉词元压缩需要根据具体输入动态调整两者的权重。为此,本文提出SAVER,一种无需训练的样本自适应视觉词元压缩框架。SAVER利用高相关视觉词元的空间分布构建几何意图先验(GIP),据此估计当前样本所需的相关性—多样性平衡。在词元选择过程中,本文进一步提出加权文本中心(WTC)和视觉边际覆盖增益(VMCG),分别用于衡量视觉词元与文本提示的相关性,以及所选词元对图像内容的覆盖能力。整个框架仅在推理阶段运行,无需额外训练或辅助预测模块。在多个视觉问答与多模态推理基准以及不同模型架构上的实验结果验证了SAVER的有效性。
附件:
