中文

LLM生成的负面新闻标题数据集:创建与对抗真实新闻基准

人工智能 2025-11-18 v1 计算与语言

摘要

本研究考察了大型语言模型(LLM)生成数据集用于支持自然语言处理(NLP)任务的潜力,旨在克服与真实数据相关的获取和隐私问题。聚焦于负面情感文本,这是情感分析的关键组成部分,我们探索使用LLM生成的合成新闻标题作为替代真实数据的途径。通过针对性提示构建了一套负面新闻标题语料库,以捕获各社会领域中多样化的负面情感。所生成的标题经专家审核,并进一步在嵌入空间中分析,以评估其在内容、语气、长度和风格方面与真实负面新闻的一致性。评估了关键指标,如与真实标题的相关性、困惑度、连贯性和真实性。将合成数据集与两套真实新闻标题进行基准测试,评估包括比较困惑度测试、比较可读性测试、比较POS轮廓、BERTScore和比较语义相似性。结果显示,生成的标题与真实标题高度匹配,唯一的显著差异出现在POS轮廓测试中 proper noun 的得分上。

关键词

引用

@article{arxiv.2511.11591,
  title  = {LLM-Generated Negative News Headlines Dataset: Creation and Benchmarking Against Real Journalism},
  author = {Olusola Babalola and Bolanle Ojokoh and Olutayo Boyinbode},
  journal= {arXiv preprint arXiv:2511.11591},
  year   = {2025}
}

备注

50 pages, 19 figures, 9 tables