中文

Tonguescape:探索语言模型对元音发音的理解

计算与语言 2025-01-30 v1 人工智能

摘要

元音主要由舌位特征界定。人类通过自身经验和明确的观察(如使用MRI)发现这些元音发音特征。凭借这种知识和我们的经验,我们可以解释和理解舌位与元音之间的关系,这对语言学习者的发音学习有帮助。由于语言模型(LMs)在包含语言和医学领域的大量数据上进行训练,我们的初步研究表明,语言模型能够解释元音的发音机制。然而,是否存在多模态语言模型(如视觉语言模型)将文本信息与视觉信息对齐仍不明确。一个问题是:语言模型是否将实际的舌位与元音发音关联?在本研究中,我们从现有的实时MRI数据集中创建了视频和图像数据集,并调查了基于视觉信息的语言模型是否能够理解元音发音。我们的发现表明,语言模型在提供参考示例时表现出理解元音和舌位的潜力,但在没有参考示例时则存在困难。我们的数据集构建代码已在GitHub上提供。

关键词

引用

@article{arxiv.2501.17643,
  title  = {Tonguescape: Exploring Language Models Understanding of Vowel Articulation},
  author = {Haruki Sakajo and Yusuke Sakai and Hidetaka Kamigaito and Taro Watanabe},
  journal= {arXiv preprint arXiv:2501.17643},
  year   = {2025}
}

备注

Accepted to NAACL 2025