中文

MuPHI:通过语义锚定奖励优化学习隐式多模态伤害推理

人工智能 2026-05-29 v1 计算与语言 机器学习 多媒体

摘要

理解伤害如何从 otherwise benign 的图像-文本对之间产生的互动,要求超越表面特征的意图感知跨模态推理。现有的视觉-语言模型(VLM)在感知线索上的字面推理方面表现出色,但往往无法推导依赖于隐式、情境依赖性推理的有害语义。为评估 VLM 在组合式伤害检测与推理方面的表现,我们引入 Multimodal Pragmatic Harm Interpretation (MuPHI),一个包含图像-文本对的数据集,其中伤害编码在细微的多模态线索中。MuPHI 涵盖多样化的伤害类别,并包含用于评估 VLM 推理链的标注伤害理由。为提高 VLM 在检测和推理方面的性能,我们提出 MuPHIRM,一个推理增强的训练框架,通过优化多视角奖励来学习联合语义。MuPHIRM 在提升 VLM 的伤害检测和推理质量方面取得显著效果,并且在对训练和推理时基线的 out-of-distribution 鲁棒性方面表现出色。我们的发现表明,推理导向的奖励优化为构建超越基准特定捷径的多模态系统提供了有前景的方向。

关键词

引用

@article{arxiv.2605.29951,
  title  = {MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization},
  author = {Anisha Saha and Varsha Suresh and Teodora Kamova and Sophia Wiedmann and Timothy Hospedales and Vera Demberg},
  journal= {arXiv preprint arXiv:2605.29951},
  year   = {2026}
}