稀有样本关系分类中的多样性胜于数量:一项经验教训
计算与语言
2024-12-10 v1 机器学习
摘要
在稀有样本关系分类(FSRC)中,模型必须仅凭少量标记样本对新关系进行泛化。尽管近年 NLP 进展聚焦于扩大数据规模,但我们认为关系类型的多样性对 FSRC 性能更为关键。在本工作中,我们通过系统实验表明,训练于多样化关系集合可显著提升模型对未见关系的泛化能力,即使整体数据规模不变。我们引入 REBEL-FS,一个新的 FSRC 基准,包含比现有数据集多一个数量级的关系类型。通过系统性实验,我们展示了增加训练数据中关系类型多样性可在各种稀有样本学习情景中实现持续的性能提升,包括高负样本情景。我们的发现挑战了“更多数据必然带来更好性能”的常见假设,表明以多样性为导向的数据 curated 策略可显著降低 FSRC 中大规模数据集的需求。
关键词
引用
@article{arxiv.2412.05434,
title = {Diversity Over Quantity: A Lesson From Few Shot Relation Classification},
author = {Amir DN Cohen and Shauli Ravfogel and Shaltiel Shmidman and Yoav Goldberg},
journal= {arXiv preprint arXiv:2412.05434},
year = {2024}
}