中文

ViFactCheck:面向越南语多领域新闻事实核查的基准数据集与方法

计算与语言 2024-12-23 v1 信息检索

摘要

数字时代信息传播速度日益迅速,尤其对于资源有限的语言(如越南语)而言,有效的事实核查工具显得尤为关键。为应对这一挑战,我们介绍了 ViFactCheck,首个专为越南语事实核查设计的公开基准数据集。该数据集包含 7,232 对由专业人士人工标注的主张-证据配对,来源于来自多个主流越南新闻网站的素材,覆盖 12 个多样化主题。数据集经过严谨的标注流程确保高质量和可靠性,实现 Fleiss Kappa 互评分数为 0.83。我们的评估采用最先进的预训练模型和大语言模型,运用微调和提示技术进行性能测试。值得注意的是,Gemma 模型表现卓越,获得微 F1 分数为 89.90%,为事实核查基准设立了新标准。该结果表明 Gemma 在准确识别和验证越南语事实方面具有强大的能力。为进一步推动事实核查技术的发展并提高数字媒体信息的可靠性,我们已将 ViFactCheck 数据集、模型检查点、事实核查管道及源码全部免费发布在 GitHub 上。此举旨在激发进一步的研究并提升低资源语言环境下信息准确性。

关键词

引用

@article{arxiv.2412.15308,
  title  = {ViFactCheck: A New Benchmark Dataset and Methods for Multi-domain News Fact-Checking in Vietnamese},
  author = {Tran Thai Hoa and Tran Quang Duy and Khanh Quoc Tran and Kiet Van Nguyen},
  journal= {arXiv preprint arXiv:2412.15308},
  year   = {2024}
}

备注

Accepted at AAAI'2025 Main Conference