中文

跨模态与知识迁移:增强多模态理解与识别

计算机视觉与模式识别 2025-12-24 v1

摘要

本稿探讨了多模态对齐、翻译、融合与迁移,以增强机器对复杂输入的理解。我们将工作组织为五个章节,每个章节解决多模态机器学习中的独特挑战。第 3 章引入 Spatial-Reasoning Bert,用于将文本中的空间关系翻译为 clip-art 之间的二维布局,有效地将空间语言解码为视觉表征,为与人类空间理解相符的自动化场景生成提供了可能。第 4 章提出将医学文本翻译到解剖轴谱图中特定 3D 位置的方法,引入一种利用医学术语空间共现关系的损失函数,创建可解释的映射,显著提升医学文本的可导航性。第 5 章解决将结构化文本翻译到知识图谱中的规范事实的问题,开发了将自然语言链接到实体和谓词的基准,解决文本抽取中的歧义问题,提供更清晰、可操作的见解。第 6 章探讨用于组合动作识别的多模态融合方法,提出一种融合视频帧和目标检测表征的方法,提高了识别的鲁棒性和准确性。第 7 章研究用于偶然动作识别的多模态知识迁移,演示了如何通过多模态知识蒸馏,使仅依赖 RGB 的模型模仿多模态融合方法的能力,减少计算需求同时保持性能。这些贡献推动了空间语言理解、医学文本解释、知识图谱丰富化和动作识别等方法论的发展,增强了计算系统处理复杂多模态输入的能力,适用于多样化应用。

关键词

引用

@article{arxiv.2512.20501,
  title  = {Bridging Modalities and Transferring Knowledge: Enhanced Multimodal Understanding and Recognition},
  author = {Gorjan Radevski},
  journal= {arXiv preprint arXiv:2512.20501},
  year   = {2025}
}

备注

Ph.D. manuscript; Supervisors/Mentors: Marie-Francine Moens and Tinne Tuytelaars