ADAB:阿拉伯语 politeness 数据集用于自动化政治礼仪基准测试——大规模计算社会语用学资源
计算与语言
2026-02-24 v2
摘要
文化感知的自然语言处理系统的日益重要性,导致对捕捉跨语言社会语用现象的资源需求不断增加。然而,尽管阿拉伯语沟通中嵌入了丰富且复杂的礼仪表达,但阿拉伯语礼仪检测资源仍处于探索不足的状态。本文介绍了 ADAB(阿拉伯语礼仪数据集),一个收集自四个在线平台(包括社交媒体、电子商务和客户服务领域)的新型标注阿拉伯语数据集,覆盖现代标准阿拉伯语及多方言(阿拉伯半岛、埃及、黎巴嫩及摩洛哥阿拉伯语)。该数据集基于阿拉伯语言传统和语用理论进行标注,分为礼貌、不礼貌和中性三个类别。包含 10,000 个样本,涵盖 16 个礼仪类别的语言特征标注,实现了显著的注释者间一致性(kappa=0.703)。我们对 40 种模型配置进行基准测试,包括传统机器学习、基于 transformer 的模型和大语言模型。该数据集旨在支持阿拉伯语礼仪感知 NLP 研究。
引用
@article{arxiv.2602.13870,
title = {ADAB: Arabic Dataset for Automated Politeness Benchmarking -- A Large-Scale Resource for Computational Sociopragmatics},
author = {Hend Al-Khalifa and Nadia Ghezaiel and Maria Bounnit and Hend Hamed Alhazmi and Noof Abdullah Alfear and Reem Fahad Alqifari and Ameera Masoud Almasoud and Sharefah Al-Ghamdi},
journal= {arXiv preprint arXiv:2602.13870},
year = {2026}
}
备注
Paper accepted @ The Fifteenth biennial Language Resources and Evaluation Conference (LREC2026)