中文

口语的视觉接地模型:数据集、架构与评估技术综述

人工智能 2022-02-22 v3 计算与语言 机器学习 声音 音频与语音处理

摘要

本综述概述了过去20年间口语视觉接地模型的发展演进。此类模型受到以下观察的启发:儿童在习得语言时,依赖于广泛间接且含噪的线索,其中关键包括与口语话语共现的视觉模态信号。多个领域为这种建模或模仿语言学习过程的方法作出了重要贡献:机器学习、自然语言与语音处理、计算机视觉以及认知科学。本文汇集了这些贡献,以便为所有这些领域的从业者提供有益的介绍与概览。我们讨论了所解决的核心研究问题、发展时间线,以及支撑了诸多此项工作的数据集。随后我们总结了主要建模架构,并对评估指标与分析技术给出了详尽的概览。

关键词

引用

@article{arxiv.2104.13225,
  title  = {Visually grounded models of spoken language: A survey of datasets, architectures and evaluation techniques},
  author = {Grzegorz Chrupała},
  journal= {arXiv preprint arXiv:2104.13225},
  year   = {2022}
}