C-MTCSD:中文多轮对话立场检测数据集
计算与语言
2025-04-21 v2
摘要
立场检测已成为分析社交媒体公共讨论的重要工具。当前方法在中文语言处理和多轮对话分析方面面临诸多挑战。为此,我们引入 C-MTCSD,即目前规模最大的中文多轮对话立场检测数据集,包含 24,264 个经过严格标注的实例,规模是唯一一个已知的中文对话式立场检测数据集的 4.2 倍。我们使用传统方法和大语言模型对 C-MTCSD 进行全面评估,揭示了其复杂性:即使在具有挑战性的零样本设置下,最先进模型也仅能达到 64.07% 的 F1 分数,而随着对话深度的增加,性能始终恶化。传统模型在隐式立场检测方面尤为吃力,F1 分数低于 50%。本工作建立了一个具有挑战性的新基准,为中文立场检测研究指明了明确的方向,同时为未来改进提供了广阔机遇。
引用
@article{arxiv.2504.09958,
title = {C-MTCSD: A Chinese Multi-Turn Conversational Stance Detection Dataset},
author = {Fuqiang Niu and Yi Yang and Xianghua Fu and Genan Dai and Bowen Zhang},
journal= {arXiv preprint arXiv:2504.09958},
year = {2025}
}
备注
WWW2025