LLM能否增强低资源阅读理解数据集?机遇与挑战
计算与语言
2024-07-11 v2 人工智能
摘要
大语言模型(LLM)在广泛的 NLP 任务上展现了令人印象深刻的零样本性能,表现出推理与应用常识的能力。一个相关应用是利用它们为下游任务创建高质量合成数据集。在本工作中,我们探究 GPT-4 是否可用于增强现有的抽取式阅读理解数据集。自动化数据标注过程有潜力节省手动标注数据集所投入的大量时间、金钱与精力。本文中,我们通过比较微调后的性能以及标注相关成本,评估 GPT-4 作为低资源阅读理解任务人类标注者替代方案的表现。本工作是首个将 LLM 作为 QA 系统合成数据增强器的分析,凸显了独特的机遇与挑战。此外,我们发布了低资源数据集的增强版本,将使研究界能够创建进一步的基准以评估生成的数据集。
引用
@article{arxiv.2309.12426,
title = {Can LLMs Augment Low-Resource Reading Comprehension Datasets? Opportunities and Challenges},
author = {Vinay Samuel and Houda Aynaou and Arijit Ghosh Chowdhury and Karthik Venkat Ramanan and Aman Chadha},
journal= {arXiv preprint arXiv:2309.12426},
year = {2024}
}
备注
ACL 2024 SRW