TASeg: 基于视觉基础模型微调的文本感知RGB-T语义分割
计算机视觉与模式识别
2025-06-30 v1
摘要
开放环境的可靠语义分割对于智能系统至关重要,但仍存在显著问题:1) 现有的RGB-T语义分割模型主要依赖低级视觉特征,缺乏高级文本信息,在类别具有相似视觉特征时难以进行准确分割。2) 虽然SAM在实例级分割方面表现出色,但将其与热图像和文本集成受到模态异质性和计算效率低下的阻碍。为了解决这些问题,我们提出了TASeg,一个利用低秩适配微调技术来适配视觉基础模型的文本感知RGB-T分割框架。具体来说,我们在图像编码器中提出了一个动态特征融合模块,该模块在冻结SAM原始Transformer模块的同时,有效地融合了来自多个视觉模态的特征。此外,我们在掩码解码器中引入了CLIP生成的文本嵌入以实现语义对齐,这进一步纠正了分类错误并提高了语义理解准确性。跨多个数据集的实验结果表明,我们的方法在具有挑战性的场景中,以更少的可训练参数实现了优越的性能。
引用
@article{arxiv.2506.21975,
title = {TASeg: Text-aware RGB-T Semantic Segmentation based on Fine-tuning Vision Foundation Models},
author = {Meng Yu and Te Cui and Qitong Chu and Wenjie Song and Yi Yang and Yufeng Yue},
journal= {arXiv preprint arXiv:2506.21975},
year = {2025}
}
备注
6 pages, accepted for publication in lEEE/RSJ international Conference on Intelligent Robots and Systems (lROS 2025)