近日,CVPR 2026 VizWiz Grand Challenge Workshop公布竞赛结果,实验室团队(梁浩、陶远航、阚美娜、山世光、陈熙霖)获得Grounding All Focus Regions for Visual Questions赛道冠军,并获得Grounding All Valid Answers赛道亚军。实验室团队长期开展面向盲人及低视力用户的智能辅助研究,持续推进可穿戴智能导航系统研究,致力于利用人工智能技术帮助视觉障碍人士更好地生活。此次在VizWiz竞赛中取得一冠一亚,是团队在助盲助残和无障碍人工智能方向取得的又一项成果。


图 1 CVPR2026 VizWiz Workshop 团队获奖证书
VizWiz竞赛聚焦盲人及低视力用户在真实场景中的视觉问答需求,旨在推动人工智能技术服务于视觉障碍人士的信息获取与环境理解。真实环境中的图像往往存在模糊、遮挡、曝光不足等问题,用户提出的问题也可能具有一定的开放性和不确定性,同一个问题有时对应多个合理答案或多个需要关注的视觉区域。因此,相关任务不仅要求模型回答用户提出的问题,还要求模型识别与问题相关的全部视觉证据,为盲人及低视力用户提供更加完整、准确的辅助信息。
针对Grounding All Focus Regions for Visual Questions任务,团队提出了基于多输出格式化的生成式方法,将用户问题理解、视觉区域定位和焦点歧义识别进行统一建模。该方法结合Qwen3-VL多模态大模型和SAM3分割大模型,促使模型针对同一问题生成多个候选视觉区域,并通过后续区域筛选与一致性分析,判断图像中是否存在多个合理的关注区域。相较于容易聚焦单一显著目标的传统方法,该方法能够更充分地考虑真实场景中的视觉多样性,减少因遗漏相关区域而造成的辅助信息不完整问题。此外,团队针对目标任务训练数据规模有限的特点,采用跨数据集学习和零样本迁移策略,仅利用大规模视觉问答数据进行训练,使模型能够将已学习到的视觉差异建模能力迁移至新的焦点歧义定位任务。
在Grounding All Valid Answers赛道中,团队针对同一视觉问题可能存在多个合理答案的情况,对答案及其对应的视觉区域进行联合建模,获得该赛道亚军。
此次在CVPR 2026 VizWiz Workshop中取得一冠一亚,体现了实验室在面向盲人及低视力用户的智能辅助与无障碍人工智能方向的持续研究积累。相关成果将为进一步提升导盲系统对复杂视觉环境的理解能力和辅助信息反馈能力提供技术积累。
附件: