中文

面向低资源印度语言的事实核查因式分解

计算与语言 2021-02-24 v1 计算机与社会

摘要

技术的进步和互联网在个体中的普及正在革新实时信息。无需经过任何可信度检查即可表达观点的自由,导致生态系统中虚假内容的传播。这可能对个人和整个社会产生灾难性影响。假新闻的放大在印度也变得猖獗。被辟谣的信息常以替换描述的方式重新发布,声称其描绘的是不同的事件。为遏制此类捏造故事,有必要调查此类重复项和公开场合的虚假声明。关于自动事实核查和假新闻检测的大多数研究仅限于英语。但对于印度这样一个仅10%受过教育的人口说英语的国家,地区语言在传播虚假信息中的作用不可低估。在本文中,我们引入FactDRIL:首个面向印度地区语言的大规模多语言事实核查数据集。我们收集了跨越7个月、覆盖11种低资源语言的详尽数据集。我们提出的数据集包含9058条英语样本、5155条印地语样本,其余8222条样本分布在各种地区语言中,即孟加拉语、马拉地语、马来亚拉姆语、泰卢固语、泰米尔语、奥里亚语、阿萨姆语、旁遮普语、乌尔都语、僧伽罗语和缅甸语。我们还展示了FactDRIL中三个M(多语言、多媒体、多领域)的详细特征描述,并附上构成其独特研究价值的其他 varied 属性完整列表。最后,我们给出了该数据集的一些潜在用例。我们期望该数据集将成为宝贵资源,并作为对抗低资源语言中假新闻扩散的起点。

关键词

引用

@article{arxiv.2102.11276,
  title  = {Factorization of Fact-Checks for Low Resource Indian Languages},
  author = {Shivangi Singhal and Rajiv Ratn Shah and Ponnurangam Kumaraguru},
  journal= {arXiv preprint arXiv:2102.11276},
  year   = {2021}
}

备注

15 pages, 6 figures