中文

藏语与人工智能:资源、方法与挑战的综合调查

计算与语言 2025-10-23 v1

摘要

藏语是亚洲主要的低资源语言之一,具有独特的语言和社会文化特征,为 AI 研究带来挑战与机遇。尽管开发针对边缘语言的人工智能系统正日益受到关注,但由于缺乏可访问的数据资源、标准化基准和专用工具,藏语在此领域受到有限的关注。本文提供了藏语 AI 当前研究状态的综合调查,涵盖文本和语音数据资源、自然语言处理任务、机器翻译、语音识别以及最新大语言模型的发展。我们系统地对现有数据集和工具进行分类,评估不同任务中使用的方法,并在可能的情况下进行性能比较。我们还识别出数据稀疏、正字法变异以及缺乏统一评估指标等持久瓶颈。此外,我们讨论了跨语言迁移、多模态学习和社区驱动资源创建的潜力。本次调查旨在为未来藏语 AI 研究提供基础参考,鼓励合作构建面向低资源语言的包容性和可持续的 AI 生态系统。

关键词

引用

@article{arxiv.2510.19144,
  title  = {Tibetan Language and AI: A Comprehensive Survey of Resources, Methods and Challenges},
  author = {Cheng Huang and Nyima Tashi and Fan Gao and Yutong Liu and Jiahao Li and Hao Tian and Siyang Jiang and Thupten Tsering and Ban Ma-bao and Renzeg Duojie and Gadeng Luosang and Rinchen Dongrub and Dorje Tashi and Jin Zhang and Xiao Feng and Hao Wang and Jie Tang and Guojie Tang and Xiangxiang Wang and Jia Zhang and Tsengdar Lee and Yongbin Yu},
  journal= {arXiv preprint arXiv:2510.19144},
  year   = {2025}
}