通过基于LLM的数据增强解决层次化学科主题推断中的数据不平衡问题
计算与语言
2023-10-17 v2
摘要
针对自然语言处理领域内的数据不平衡问题,文本数据增强方法已成为关键解决方案。这种数据不平衡普遍存在于资助申请过程中提交的研究计划书中。此类不平衡源于学科热度差异或交叉学科研究的出现,严重阻碍了推断这些计划书所属学科的下游主题模型的精度。在数据层面,专家与科学家撰写的研究计划书本质上是复杂的技术文本,充满专业术语,增强此类专用文本数据带来独特挑战。在系统层面,这进而损害了AI辅助审稿人分配系统的公平性,使解决该问题备受关注。本研究利用大语言模型(Llama V1)作为数据生成器,增强归属于复杂学科层次的研究计划书,旨在纠正数据不平衡并提升专家分配的公平性。我们首先在层次结构中采样以找到代表性不足的类,随后设计了基于关键词的研究计划书生成提示。我们的实验证实了生成数据的有效性,表明使用该提示生成的研究计划书能有效解决上述问题并产出高质量科学文本数据,从而帮助模型克服不平衡问题。
引用
@article{arxiv.2310.05318,
title = {Resolving the Imbalance Issue in Hierarchical Disciplinary Topic Inference via LLM-based Data Augmentation},
author = {Xunxin Cai and Meng Xiao and Zhiyuan Ning and Yuanchun Zhou},
journal= {arXiv preprint arXiv:2310.05318},
year = {2023}
}
备注
6 pages, accepted by ICDM 2023