中文

VietMEAgent:针对越南视觉问答的文化感知少样多模态解释

计算机视觉与模式识别 2025-11-13 v1

摘要

当面对文化特定内容时,当前的视觉问答(VQA)系统受限较大,主要由于训练语料中缺乏文化知识且推理过程对最终用户不可解释。本文引入VietMEAgent,一个为越南文化理解而设计的多模态可解释框架。该方法集成文化物体检测主干网络与结构化程序生成层,形成一个答案预测与解释紧密耦合的管道。精选的越南文化实体知识库作为明确的背景信息来源,而双模态解释模块则结合基于注意力的视觉证据与结构化、人类可读的文本理由。我们进一步构建了一个来自公共存储库的越南文化VQA数据集,并用以演示基于编程的方法在文化AI中的实际应用。该系统提供透明的解释,揭示计算理由及其背后的文化背景,支持教育和文化保存,强调可解释性和文化敏感性。

关键词

引用

@article{arxiv.2511.09058,
  title  = {VietMEAgent: Culturally-Aware Few-Shot Multimodal Explanation for Vietnamese Visual Question Answering},
  author = {Hai-Dang Nguyen and Minh-Anh Dang and Minh-Tan Le and Minh-Tuan Le},
  journal= {arXiv preprint arXiv:2511.09058},
  year   = {2025}
}

备注

7 pages, 3 figures, 3 tables, FAIR 2025 conference