SemViQA:面向越南信息核查的语义问答系统
计算与语言
2025-10-07 v3 人工智能
摘要
大语言模型(如 GPT 和 Gemini)的兴起加剧了虚假信息的泛滥,尤其在资源匮乏的语言如越南语方面亟需稳健的事实核查解决方案。现有方法在处理语义模糊、同义词以及复杂语言结构时常在准确率与效率之间权衡。我们提出 SemViQA,一个新的越南语事实核查框架,集成了语义证据检索(SER)和两步裁决分类(TVC)。我们的方法在精度和速度之间取得平衡,实现了在 ISE-DSC01 上的 78.97% 严格准确率,在 ViWikiFC 上的 80.82% 准确率,夺得 UIT 数据科学挑战赛的第 1 名。此外,SemViQA Faster 在保持具竞争力准确率的同时将推理速度提升了 7 倍。SemViQA 为越南语事实验证树立了新基准,推动了反虚假信息斗争的进程。源代码可在:https://github.com/DAVID-NGUYEN-S16/SemViQA 获取。
引用
@article{arxiv.2503.00955,
title = {SemViQA: A Semantic Question Answering System for Vietnamese Information Fact-Checking},
author = {Dien X. Tran and Nam V. Nguyen and Thanh T. Tran and Anh T. Hoang and Tai V. Duong and Di T. Le and Phuc-Lu Le},
journal= {arXiv preprint arXiv:2503.00955},
year = {2025}
}
备注
18 pages