中文

ReadMe++:面向多领域可读性评估的多语言语言模型基准评测

计算与语言 2024-10-17 v4 人工智能 机器学习

摘要

我们对多语言可读性评估中的大语言模型进行了全面评测。现有的评测资源缺乏领域与语言多样性,限制了跨领域与跨语言分析的能力。本文提出 ReadMe++,一个包含来自 112 个不同数据源的阿拉伯语、英语、法语、印地语和俄语共 9757 个句子人工标注的多语言多领域数据集。该基准将促进鲁棒多语言可读性评估方法的研究。利用 ReadMe++,我们在有监督、无监督和少样本提示(few-shot prompting)设定下对多语言与单语言语言模型进行了基准评测。ReadMe++ 中的领域与语言多样性使我们能够测试更有效的少样本提示,并识别最先进无监督方法的不足。我们的实验还揭示了令人振奋的结果:在 ReadMe++ 上训练的模型具有更优的领域泛化能力和增强的跨语言迁移能力。我们将公开我们的数据,并在 https://github.com/tareknaous/readme 发布一个使用我们训练模型进行多语言句子可读性预测的 python 包工具。

关键词

引用

@article{arxiv.2305.14463,
  title  = {ReadMe++: Benchmarking Multilingual Language Models for Multi-Domain Readability Assessment},
  author = {Tarek Naous and Michael J. Ryan and Anton Lavrouk and Mohit Chandra and Wei Xu},
  journal= {arXiv preprint arXiv:2305.14463},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 Main Conference