中文

注意你的莫拉:面向正字法的神经日语形态生成错误分析

计算与语言 2026-05-25 v2

摘要

我们提出了一种面向正字法的日语过去时形态屈折错误分析,将平假名不仅视为转录媒介,而且视为一种编码了可能影响模型泛化能力的形态音位区别的表征系统。我们使用根据SIGMORPHON 2020和2023共享任务约定格式化的数据集,在两种字符级序列到序列架构上评估了过去时构成。尽管总体准确率很高,模型仍表现出系统性的、语言学上可解释的错误,这些错误集中在平假名的特定正字法属性周围。我们引入了一个简洁的错误分类法,捕捉了七种主要失败模式,并提供了定量和定性分析。与促音化相关的错误在残余失败中占主导地位,占错误的75-80%,尤其是在词干以元音e结尾且在过去时后缀前需要促音化的动词中。错误模式在不同架构和随机种子间保持高度一致,表明正字法表征、形态结构和数据频率效应在塑造模型泛化能力方面存在稳健的相互作用。这些结果强调了面向正字法的评估对于理解形态复杂语言中神经泛化的必要性。

关键词

引用

@article{arxiv.2605.20043,
  title  = {Mind Your Moras: Orthography-Aware Error Analysis of Neural Japanese Morphological Generation},
  author = {Wen Zhang},
  journal= {arXiv preprint arXiv:2605.20043},
  year   = {2026}
}