中文

基于可靠时空体素的多模态分割交互式测试时自适应

计算机视觉与模式识别 2025-10-07 v5

摘要

多模态测试时自适应 (MM-TTA) 以在线方式利用互补的多模态输入,使模型自适应于无标注目标域。尽管先前用于 3D 分割的 MM-TTA 方法通过逐帧自精炼提供了有前景的解决方案,但它们存在两个主要局限性:1) 由时间不一致导致的逐帧预测不稳定,以及 2) 违反可靠模态指导假设的持续错误预测。为了解决这些局限性,本工作引入了一个全面的双重框架。首先,在我们之前的工作“可靠时空体素”(Latte) 的基础上,我们提出了 Latte++,它利用更具信息量的几何对应关系来更好地抑制不稳定的逐帧预测。Latte++ 不使用通用的滑动窗口,而是采用多窗口聚合来捕获更可靠的对应关系,以更好地评估不同语义类别的局部预测一致性。其次,为了解决持续错误预测的问题,我们提出了交互式测试时自适应 (ITTA),这是一个灵活的附加组件,旨在为现有的 MM-TTA 方法赋能轻松的人类反馈。ITTA 引入了一种新颖的人在回路方法,通过交互式分割高效整合最少的人类反馈,仅需简单的点击和边界框标注。ITTA 不使用独立的交互网络,而是采用带有动量梯度模块的轻量级可提示分支,以在在线推理期间捕获并重用来自稀缺人类反馈的知识。在五个 MM-TTA 基准上的广泛实验表明,ITTA 在具有挑战性的不平衡场景中实现了对感兴趣目标类别的一致且显著的改进与稳健的性能提升,而 Latte++ 为时间稳定性提供了互补的收益。

关键词

引用

@article{arxiv.2403.06461,
  title  = {Interactive Test-Time Adaptation with Reliable Spatial-Temporal Voxels for Multi-Modal Segmentation},
  author = {Haozhi Cao and Yuecong Xu and Pengyu Yin and Xingyu Ji and Shenghai Yuan and Jianfei Yang and Lihua Xie},
  journal= {arXiv preprint arXiv:2403.06461},
  year   = {2025}
}