中文

《瑞迪维斯》梵语文本的音调定位模型

计算与语言 2025-12-01 v1

摘要

《瑞迪维斯》是印度最古老的梵语文本之一,采用独特的升降调系统:udatta、anudatta、svarita,其音调标记编码了旋律和解释线索,但在现代电子文本中常常缺失。本 work 构建了一个包含带音调与不带音调诵句的平行语料库,并对三种《瑞迪维斯》诵句自动音调定位策略进行了受控比较:(i) 对 ByT5 进行完整微调,该模型直接在 Unicode 组合标记上 operate; (ii) 从零构建的 BiLSTM-CRF 序列标注基线; (iii) 基于 ByT5 的 LoRA 参数高效微调方法。在评估中,我们采用词错误率 (WER) 和字符错误率 (CER) 衡量拼写忠实度,另外引入一种专门的 Diacritic Error Rate (DER),专用于隔离音调编辑错误。完全的 ByT5 微调在所有指标上均取得最低错误率; LoRA 在效率与准确性之间提供了强大的权衡,BiLSTM-CRF 作为透明的基线。该研究强调了音调恢复的实际要求——Unicode 安全的预处理、标记感知的 tokenization,以及分离 grapheme 与音调错误的评估方法——并将 heritage 语言技术定位为一个连接计算建模与史学与教育目标的新兴 NLP 领域。结果为《瑞迪维斯》音调恢复建立了可复现的基准,并为后续任务如面向音调的 OCR、ASR/合唱合成和数字人文学提供了指导。

关键词

引用

@article{arxiv.2511.23088,
  title  = {Accent Placement Models for Rigvedic Sanskrit Text},
  author = {Akhil Rajeev P and Annarao Kulkarni},
  journal= {arXiv preprint arXiv:2511.23088},
  year   = {2025}
}

备注

Submitted to AACL-IJCNLP 2025