SNaRe:面向低资源事件检测的领域感知数据生成
计算与语言
2025-09-19 v3 人工智能
摘要
事件检测(ED)——从自然语言文本中识别事件提及的任务——对于在生物医学、法律和流行病学等高度专业化领域中进行推理至关重要。数据生成已被证明能有效拓宽其在更广泛应用中的效用,而无需昂贵的专家标注。然而,当现有的生成方法应用于专业领域时,它们面临标签噪声(即标注不正确)和领域漂移(以生成句子与目标领域之间的分布不匹配为特征)的困境。为了解决这些问题,我们引入了SNaRe,一个领域感知的合成数据生成框架,由三个组件组成:Scout、Narrator和Refiner。Scout从无标签的目标领域数据中提取触发词,并利用语料库级别的统计数据策划高质量的特定领域触发词列表,以缓解领域漂移。Narrator以这些触发词为条件,生成高质量且与领域对齐的句子,而Refiner识别额外的事件提及,确保高标注质量。在三个不同领域的ED数据集上的实验表明,SNaRe优于最佳基线,在零样本/少样本设置中实现了3-7%的平均F1增益,在多语言生成中实现了4-20%的F1提升。对生成的触发词命中率的分析和人工评估证实了SNaRe更强的标注质量和更小的领域漂移。
引用
@article{arxiv.2502.17394,
title = {SNaRe: Domain-aware Data Generation for Low-Resource Event Detection},
author = {Tanmay Parekh and Yuxuan Dong and Lucas Bandarkar and Artin Kim and I-Hung Hsu and Kai-Wei Chang and Nanyun Peng},
journal= {arXiv preprint arXiv:2502.17394},
year = {2025}
}
备注
Accepted at EMNLP 2025 Main