中文

PerCoR:通过多选句子填空评估波斯语常识推理

计算与语言 2026-01-19 v2 人工智能

摘要

我们提出了 PerCoR(Persian Commonsense Reasoning,波斯语常识推理),首个大规模波斯语常识推理基准数据集。PerCoR 包含 106K 多个选择题句子填空问题,来源自超过四十个新闻、文化及其他网络资料。我们提出一种基于联合词的分段策略,以生成连贯的句子填空对,实现广泛的主题和结构多样性。为创建具挑战性的干扰项,我们提出 DRESS-AF(Distractor Ranking via Embedding Similarity Scoring and Adversarial Filtering,对干扰项进行排序),这是一种无需生成的对抗式筛选方法,通过最大化模型混淆来从金标准续写词库中选择干扰项。人工标注员在 PerCoR 上取得 89% 的得分,而OpenAI-o3 实现的最高性能为 92.18%,紧随其后的是Claude-Sonnet-3.7(91.17%)。最强大的开源模型 DeepSeek-R1 达到 82.51%,凸显了数据集的难度以及波斯语常识推理中仍存的性能差距。我们进一步表明 DRESS-AF 可迁移至英语 HellaSwag基准,提升难度且不影响人类可解性。数据集已发布于 https://huggingface.co/datasets/MCINext/PerCoR。

关键词

引用

@article{arxiv.2510.22616,
  title  = {PerCoR: Evaluating Commonsense Reasoning in Persian via Multiple-Choice Sentence Completion},
  author = {Morteza Alikhani and Mohammadtaha Bagherifard and Erfan Zinvandi and Mehran Sarmadi},
  journal= {arXiv preprint arXiv:2510.22616},
  year   = {2026}
}

备注

20 pages, 17 figures, Accepted to IJCNLP-AACL 2025 (Main Conference)