中文

基于推理引导的噪声多语言社交媒体帖子的主张归一化

计算与语言 2025-11-10 v1

摘要

本文针对多语言虚假信息检测中的主张归一化问题,提出将噪声社交媒体帖子转化为跨20种语言清晰可验证的陈述的方法。关键贡献在于演示如何通过对帖子进行系统性分解(使用谁、什么、哪里、什么时候、为什么和如何问题),即可在仅使用英文数据进行训练的情况下实现稳健的跨语言迁移。我们的方法在数据提供后对Qwen3-14B进行LoRA微调,结合帖子内部去重、基于词级别召回过滤进行语义对齐,以及在推理阶段使用带有上下文示例的检索增强few-shot学习。我们的系统在METEOR分数上达到41.16(英文)至15.21(马拉地)之间,英文排名第三,荷兰文和旁遮yu文分别排名第四。该方法相较于基线配置实现了41.3%的METEOR相对提升,并显著优于现有方法。结果表明该方法在罗曼语和日耳曼语语言间展现出有效的跨语言泛化能力,同时在多样化的语言结构中保持语义连贯性。

关键词

引用

@article{arxiv.2511.05078,
  title  = {Reasoning-Guided Claim Normalization for Noisy Multilingual Social Media Posts},
  author = {Manan Sharma and Arya Suneesh and Manish Jain and Pawan Kumar Rajpoot and Prasanna Devadiga and Bharatdeep Hazarika and Ashish Shrivastava and Kishan Gurumurthy and Anshuman B Suresh and Aditya U Baliga},
  journal= {arXiv preprint arXiv:2511.05078},
  year   = {2025}
}