中文

面向跨领域隐式篇章关系识别合成数据增强

计算与语言 2025-03-27 v1

摘要

隐式篇章关系识别(IDRR)——识别两个文本片段之间隐式连贯关系的任务——需要深层次的语义理解。已有研究表明,零样本或少样本方法显著落后于有监督模型,但 LLM 可用于合成数据增强,即由 LLM 按照指定的连贯关系生成第二个论元。我们在跨领域设定下应用了该方法,利用未标注的目标领域数据生成篇章延续,以适配一个在源领域标注数据上训练好的基础模型。在大规模测试集上的评估表明,该方法的不同变体并未带来显著提升。我们得出结论:LLM 常常无法为 IDRR 生成有用的样本,并强调在评估 IDRR 模型时同时考虑统计显著性与可比性的重要性。

关键词

引用

@article{arxiv.2503.20588,
  title  = {Synthetic Data Augmentation for Cross-domain Implicit Discourse Relation Recognition},
  author = {Frances Yung and Varsha Suresh and Zaynab Reza and Mansoor Ahmad and Vera Demberg},
  journal= {arXiv preprint arXiv:2503.20588},
  year   = {2025}
}