中文

写你所想:将文本到视频检索应用于视听档案

多媒体 2023-10-10 v1 人机交互

摘要

视听(AV)档案作为我们文化资产的重要宝库,正面临可访问性方面的问题。该媒介本身的复杂性使得处理与交互仍是计算机视觉、多模态学习、人机交互以及文化与遗产领域的开放挑战。近年来,随着视频检索任务的兴起,利用自然语言检索视频内容的方法(文本到视频检索)获得了相当多的关注,并已达到可应用于现实世界的性能水平。尽管听起来诱人,此类方法侧重于使用描述视频中所发生事件的、以视觉为主的平实描述来检索视频,以及查找如教学类的视频。现在断言此类方法将成为访问复杂视频内容并将其编码为高维数据的新范式还为时过早,但它们确实是构建未来视听档案探索性界面的创新尝试与基础(例如允许用户撰写故事并检索档案中的相关片段,或对视频内容进行高层级编码以用于可视化)。本工作从实现角度考察此类文本到视频检索方法,填补了应用空白,并提出并验证了一种分类器增强的工作流,以在处理可能与训练数据集不同的现场查询时获得更好的结果。该工作流随后应用于来自 Télévision Suisse Romande (RTS) 的真实世界档案以创建演示。最后,进行了以人为中心的评估,以了解文本到视频检索方法是否改善了访问视听档案的整体体验。

关键词

引用

@article{arxiv.2310.05825,
  title  = {Write What You Want: Applying Text-to-video Retrieval to Audiovisual Archives},
  author = {Yuchen Yang},
  journal= {arXiv preprint arXiv:2310.05825},
  year   = {2023}
}