中文

视觉事件的自然语言生成:最新进展与关键开放问题

计算与语言 2025-08-21 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

近年来,视觉 grounding 的自然语言处理研究主要聚焦于描述图像或视频中呈现的内容。然而,针对这些情境下不同模态之间相互作用的性质与程度的研究相对不足。本文认为,任何处理从图像序列或帧生成自然语言的任务,都是更一般、更根本性问题的实例,即建模随时间展开的视觉事件与用于解释、描述或叙述这些事件的语言特征之间的复杂关系。因此,解决此类任务需要模型能够识别并管理此类复杂性。我们考虑五个看似不同的任务,这些任务我们认为是此更广泛多模态问题的有力实例。随后,我们概述了近年来用于这些任务的建模与评估方法,并检讨了这些任务所提出的共性挑战。基于此视角,我们确定了若干关键开放问题,并提出了若干未来研究方向。

关键词

引用

@article{arxiv.2502.13034,
  title  = {Natural Language Generation from Visual Events: State-of-the-Art and Key Open Questions},
  author = {Aditya K Surikuchi and Raquel Fernández and Sandro Pezzelle},
  journal= {arXiv preprint arXiv:2502.13034},
  year   = {2025}
}