中文

LLM能否增强低资源阅读理解数据集?机遇与挑战

计算与语言 2024-07-11 v2 人工智能

摘要

大语言模型(LLM)在广泛的 NLP 任务上展现了令人印象深刻的零样本性能,表现出推理与应用常识的能力。一个相关应用是利用它们为下游任务创建高质量合成数据集。在本工作中,我们探究 GPT-4 是否可用于增强现有的抽取式阅读理解数据集。自动化数据标注过程有潜力节省手动标注数据集所投入的大量时间、金钱与精力。本文中,我们通过比较微调后的性能以及标注相关成本,评估 GPT-4 作为低资源阅读理解任务人类标注者替代方案的表现。本工作是首个将 LLM 作为 QA 系统合成数据增强器的分析,凸显了独特的机遇与挑战。此外,我们发布了低资源数据集的增强版本,将使研究界能够创建进一步的基准以评估生成的数据集。

关键词

引用

@article{arxiv.2309.12426,
  title  = {Can LLMs Augment Low-Resource Reading Comprehension Datasets? Opportunities and Challenges},
  author = {Vinay Samuel and Houda Aynaou and Arijit Ghosh Chowdhury and Karthik Venkat Ramanan and Aman Chadha},
  journal= {arXiv preprint arXiv:2309.12426},
  year   = {2024}
}

备注

ACL 2024 SRW