中文

面向类型化感知的重排以缓解低资源语言的非忠实问题

计算与语言 2025-03-11 v2

摘要

多语言大型语言模型(LLMs)在资源受限语言中更常生成non-faithful输出(Guerreiro等,2023 - arXiv:2303.16104),可能是因为这些在句法/语义结构上具有多样性的语言在训练数据中被低估。为缓解此类情境下的non-faithfulness,我们提出使用计算开销较轻的辅助模型来对输出进行重排。作为验证此方法可行性的证据,我们展示了无需微调即可在不足700 MB数据上的单语4层BERT模型,能够以88.33%的平均准确率识别三个在形态复杂度上毫无关联的语言(越南语、波兰语和格鲁吉亚语)中忠实的摘要。相同超参数组合还良好地推广到其他三个任务,表明重排的应用远不止改善忠实度。在探讨类型化感知模型选择时,我们还研究了形态复杂度如何与正则化、模型深度和训练目标相互作用,最终表明形态复杂的语言更可能受益于dropout,而在不同语言的下游任务性能方面,浅层架构以及使用标准BERT目标进行训练效果最佳。

关键词

引用

@article{arxiv.2502.17664,
  title  = {Towards Typologically Aware Rescoring to Mitigate Unfaithfulness in Lower-Resource Languages},
  author = {Tsan Tsai Chan and Xin Tong and Thi Thu Uyen Hoang and Barbare Tepnadze and Wojciech Stempniak},
  journal= {arXiv preprint arXiv:2502.17664},
  year   = {2025}
}

备注

ISCA/ITG Workshop on Diversity in Large Speech and Language Models