中文

面向房屋损害评估的多模态RAG框架:图像编码与策略向量检索的协同优化

计算机视觉与模式识别 2025-09-15 v1 人工智能 机器学习

摘要

自然灾害后,准确评估房屋损害对保险理赔及资源调度至关重要。本文提出一种新型多模态检索增强生成(MM-RAG)框架。在经典RAG架构之上,我们构建双分支多模态编码器结构,其中图像分支采用ResNet与Transformer组合的视觉编码器提取建筑物损害特征,文本分支则利用BERT检索器对帖子、保险政策等文本进行向量化,构建可检索的索引。为实现跨模态语义对齐,模型集成跨模态交互模块,通过多头注意力机制桥接图像与文本语义表征。同时,在生成模块中,引入模态注意力门控机制,动态控制视觉证据与文本先验信息在生成过程中的作用。整个框架采用端到端训练,结合比较损失、检索损失与生成损失,形成多任务优化目标,实现图像理解与策略匹配的协同学习。实验结果在检索准确率及损害严重程度分类指标上均表现优异,其中Top-1检索准确率提升了9.6%。

关键词

引用

@article{arxiv.2509.09721,
  title  = {A Multimodal RAG Framework for Housing Damage Assessment: Collaborative Optimization of Image Encoding and Policy Vector Retrieval},
  author = {Jiayi Miao and Dingxin Lu and Zhuqi Wang},
  journal= {arXiv preprint arXiv:2509.09721},
  year   = {2025}
}