从视觉、语音与文本中进行语法诱导
计算与语言
2025-02-21 v2 人工智能
摘要
语法诱导可从丰富的异构信号(如文本、视觉和语音)中受益。在此过程中,来自不同模态的特征本质上在起到互补作用。基于此直觉,本工作引入一种新颖的无监督视觉-语音-文本语法诱导任务(命名为 VAT-GI),以从平行图像、文本和语音输入中诱导构成语法树。灵感来源于语言语法本就存在于文本之外的事实,我们认为文本不必是语法诱导中的主要模态。因此,我们进一步引入 VAT-GI 的一种“无文本”设置,即仅依赖视觉和听觉输入。为解决该任务,我们提出一种视觉-语音-文本内部-外部递归自编码器(VaTiora)框架,利用丰富的模态特定和互补特征实现有效的语法解析。此外,构建了一个更具挑战性的基准数据集,以评估 VAT-GI 系统的泛化能力。实验表明,我们提出的 VaTiora 系统在整合各种多模态信号方面更有效,并在 VAT-GI 上实现了新的最先进(SOTA)性能。
引用
@article{arxiv.2410.03739,
title = {Grammar Induction from Visual, Speech and Text},
author = {Yu Zhao and Hao Fei and Shengqiong Wu and Meishan Zhang and Min Zhang and Tat-seng Chua},
journal= {arXiv preprint arXiv:2410.03739},
year = {2025}
}