中文

大语言模型的 5W1H 提取

计算与语言 2024-05-28 v1

摘要

通过 5W1H 框架 (\textit{What}, \textit{When}, \textit{Where}, \textit{Why}, \textit{Who}, 和 \textit{How}) 提取新闻要素对于事件抽取和文本摘要至关重要. 大型语言模型 (Large language models, LLMs) 如 ChatGPT 为通过简单提示解决语言相关任务提供了机会, 无需 extensive 时间进行模型微调. 尽管 ChatGPT 在处理较长新闻文本和分析特定属性方面存在挑战, 尤其是关于 \textit{What}, \textit{Why}, 和 \textit{How} 的答案. 抽取任务的效果显著依赖于高质量的人工标注数据集. 然而, 缺乏针对 5W1H 提取的数据集增加了基于开源 LLM 的微调策略的难度. 为缓解这些限制, 本文首先基于四个典型新闻语料库 (\textit{CNN/DailyMail}, \textit{XSum}, \textit{NYT}, \textit{RA-MDS}) 构建高质量 5W1H 数据集; 其次, 我们设计从零-shot/少量-shot 提示到高效微调的多种策略, 对原新闻文档中的 5W1H 方面进行抽取. 实验结果表明, 在我们标注的数据集上微调的模型性能优于 ChatGPT. 此外, 我们还通过在目标语料库 (如 CNN/DailyMail) 上测试源域 (如 NYT) 模型, 探索了域适应能力.

关键词

引用

@article{arxiv.2405.16150,
  title  = {5W1H Extraction With Large Language Models},
  author = {Yang Cao and Yangsong Lan and Feiyan Zhai and Piji Li},
  journal= {arXiv preprint arXiv:2405.16150},
  year   = {2024}
}

备注

IJCNN 2024