中文

LLM 增强的自训练用于跨域成分句法分析

计算与语言 2023-11-07 v1

摘要

自训练已被证明是跨域任务的一种有效方法,在本研究中,我们探索其在跨域成分句法分析中的应用。传统自训练方法依赖于有限且可能低质量的原始语料。为克服这一局限,我们提出利用大语言模型(LLM)增强自训练,以迭代方式生成特定领域的原始语料。针对成分句法分析,我们引入语法规则来指导 LLM 生成原始语料,并建立伪实例的选择准则。实验结果表明,配备 LLM 的成分句法分析自训练优于传统方法,且与 LLM 性能无关。此外,结合语法规则与置信度准则进行伪数据选择,在跨域成分句法分析中取得了最高性能。

关键词

引用

@article{arxiv.2311.02660,
  title  = {LLM-enhanced Self-training for Cross-domain Constituency Parsing},
  author = {Jianling Li and Meishan Zhang and Peiming Guo and Min Zhang and Yue Zhang},
  journal= {arXiv preprint arXiv:2311.02660},
  year   = {2023}
}

备注

Accepted by EMNLP 2023 main conf