FC-CONAN:用于稳健检索系统评估的全覆盖配对数据集
计算与语言
2026-01-06 v1
摘要
仇恒言论(HS)是线上话语中的重要问题,其一个有前景的策略是通过对抗叙事(CN)来应对。链接HS与CN的数据集对于推进对抗话语研究至关重要。然而,即使是像CONAN(Chung等,2019)这样的旗舰资源,仅对所有可能的HS-CN对进行稀疏注释,限制了评估。我们引入FC-CONAN(Fully Connected CONAN),这是第一个通过详尽考虑45个英文HS信息与129个CN的所有组合创建的数据集。由九名标注员和四名验证员参与的两阶段标注过程产生四个分区-Diamond、Gold、Silver和Bronze,在可靠性和规模之间进行平衡。FC-CONAN中的标注对与CONAN没有重叠,揭示了数百个此前未标注的阳性样本。FC-CONAN实现了对对抗检索系统更真实的评估,并促进了详细的错误分析。该数据集已公开提供。
引用
@article{arxiv.2601.01350,
title = {FC-CONAN: An Exhaustively Paired Dataset for Robust Evaluation of Retrieval Systems},
author = {Juan Junqueras and Florian Boudin and May-Myo Zin and Ha-Thanh Nguyen and Wachara Fungwacharakorn and Damián Ariel Furman and Akiko Aizawa and Ken Satoh},
journal= {arXiv preprint arXiv:2601.01350},
year = {2026}
}
备注
Presented at NeLaMKRR@KR, 2025 (arXiv:2511.09575)