口语意大利语数据集与语料库综述
计算与语言
2025-03-13 v2 人工智能
数字图书馆
摘要
口语数据集对于推进语言学研究、自然语言处理和语音技术至关重要。然而,与英语或汉语等主要语言相比,针对意大利语(一种语言丰富多样的罗曼语)的资源仍未得到充分探索。本综述对66个口语意大利语数据集进行了全面分析,突出了它们的特征、方法和应用。数据集按语音类型、来源和上下文、人口统计和语言特征进行分类,重点关注它们在自动语音识别、情感检测和教育等领域的实用性。讨论了与数据集稀缺性、代表性和可访问性相关的挑战,并提出了增强数据集创建和利用的建议。完整的数据集清单可通过GitHub公开获取,并归档在Zenodo上,为研究人员和开发人员提供了宝贵资源。通过解决现有差距并提出未来方向,本工作旨在支持意大利语语音技术和语言学研究的进步。
引用
@article{arxiv.2501.06557,
title = {A Survey on Spoken Italian Datasets and Corpora},
author = {Marco Giordano and Claudia Rinaldi},
journal= {arXiv preprint arXiv:2501.06557},
year = {2025}
}
备注
Published on IEEE Access Journal on Feb 2025