中文

道德语义在机器翻译中得以保存:来自道德基础语料库的跨语言证据

计算与语言 2026-05-22 v1 人工智能

摘要

道德语言细微且文化差异大,这使得在不同语言之间忠实翻译变得困难。习语、俚语和文化引用会引入难以避免的翻译制件。然而,自动化的道德价值分类依赖于语言特定的标注语料库,这些语料库几乎仅存在于英语中。我们研究了基于大语言模型的翻译是否能够填补这一鸿沟,以波兰语为测试案例。使用约5万篇来自多元话题的道德标注社交媒体帖子,我们应用了四种原则性验证方法:LaBSE跨语言嵌入相似性、中心化核对齐(CKA)、LLM评估器和深度学习分类器公平性测试。我们展示了尽管在处理俚语、粗俗用语和文化依赖性表达方面存在不足,但直接翻译足够好地保存了细微的道德线索,能够被跨语言机器学习所收集——在所有基础上平均余弦相似度为0.86,AUC差距为0.01--0.02,在大语言模型微调后进一步缩小。这些结果表明,机器翻译是道德价值研究在当前该领域资源不足的语言中一种实用且成本效益高的路径。我们以波兰语作为代表性斯拉夫语,预期可推广至相关语言。

关键词

引用

@article{arxiv.2605.22660,
  title  = {Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora},
  author = {Maciej Skorski},
  journal= {arXiv preprint arXiv:2605.22660},
  year   = {2026}
}