中文

MORPHOGEN:评估性别感知形态学生成的多语言基准

计算与语言 2026-04-22 v1 人工智能 机器学习

摘要

虽然多语言大语言模型 (LLM) 在诸如翻译和问答等高层次任务上表现良好,但其处理语法性别和形态学一致性的能力仍未得到充分探索。在高度屈折的语言中,性别会影响动词变位、代词,甚至包含显式和隐式性别提及的第一人称构造。我们引入 MORPHOGEN,一个以形态学为基础的大规模基准数据集,用于评估性别感知生成,涵盖三种类型多样的语法性别语言:法语、阿拉伯语和印地语。核心任务 GENFORM 需要模型将第一人称句子改写为相反性别,同时保持其意义和结构。我们构建了一个高质量的合成数据集,基准测试 15 个流行的多语言 LLM(规模从 2B 到 70B),评估其执行此转换的能力。我们的结果揭示了当前模型在处理形态学性别方面的显著差距和有趣的见解。MORPHOGEN 为性别感知语言建模提供了聚焦诊断视角,为未来在包容性和对形态学敏感的 NLP 研究奠定了基础。

关键词

引用

@article{arxiv.2604.18914,
  title  = {MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological Generation},
  author = {Mehul Agarwal and Aditya Aggarwal and Arnav Goel and Medha Hira and Anubha Gupta},
  journal= {arXiv preprint arXiv:2604.18914},
  year   = {2026}
}

备注

25 pages, accepted to ACL 2026 (Main)