中文

中文媒体偏见检测中的数据增强与检索增强上下文 enrichment

计算机与社会 2023-11-21 v2

摘要

随着对客观报道追求的增加,自动理解媒体偏见在近期研究中引起了更多关注。然而,以往多数工作从西方意识形态(如政治光谱中的左与右)审视媒体偏见,这并不适用于中文媒体。基于先前的词汇偏见与信息偏见结构,我们从中文视角对其细化,并进一步构建了带有 7 个细粒度标签的数据。具体而言,我们首先构建了一个由我们新设计体系标注的关于 COVID-19 的中文新闻报道数据集,然后在其上进行了大量实验以检测媒体偏见。然而,标注数据规模不足以满足最新深度学习技术,且媒体偏见中需大量专业知识的人工标注成本过于昂贵。因此,我们探索了一些上下文 enrichment 方法以自动改善这些问题。在数据增强上下文 enrichment(DACE)中,我们扩充训练数据;而在检索增强上下文 enrichment(RACE)中,我们改进信息检索方法以筛选有价值信息并整合进模型以更好理解偏见。我们在自身数据集与英文数据集 BASIL 上进行了广泛实验。结果表明两种方法均优于基线,而 RACE 方法更高效且更具潜力。

关键词

引用

@article{arxiv.2311.01372,
  title  = {Data-Augmented and Retrieval-Augmented Context Enrichment in Chinese Media Bias Detection},
  author = {Luyang Lin and Jing Li and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2311.01372},
  year   = {2023}
}