中文

用于分析中国媒体新闻框架的数据集

计算与语言 2025-07-29 v1

摘要

框架是新闻报道中的重要手段,允许作家影响对当前事务的公共感知。虽然已有针对多种语言的自动新闻框架检测数据集,但没有一个专注于中文语言的新闻框架数据集,中文具有复杂的词义和独特的语言特征。本研究介绍了第一个中文新闻框架数据集,可用作独立数据集或补充 SemEval-2023 任务 3 数据集。我们详细描述了其创建方式,并通过基线实验突出了该数据集的必要性,并为未来研究创建基准。我们提供了通过微调 XLM-RoBERTa-Base 和使用 GPT-4o 零样本 setting 获取的结果。我们发现 GPT-4o 在所有语言中均显著低于微调的 XLM-RoBERTa。对于中文语言,我们仅使用来自我们中文新闻框架数据集的样本即可获得 F1-micro(SemEval 任务 3,子任务 2 的绩效指标)得分为 0.719,当我们将 SemEval 数据集增强为包含中文新闻框架样本时得分为 0.753。尽管新闻框架检测结果良好,该数据集是检测中文新闻框架的宝贵资源,是 SemEval-2023 任务 3 数据集的有价值的补充。

关键词

引用

@article{arxiv.2503.04439,
  title  = {A Dataset for Analysing News Framing in Chinese Media},
  author = {Owen Cook and Yida Mu and Xinye Yang and Xingyi Song and Kalina Bontcheva},
  journal= {arXiv preprint arXiv:2503.04439},
  year   = {2025}
}