预测市场中的立场检测:通过反事实数据增强解决交易者评论的类别不平衡问题
计算与语言
2026-05-28 v1
摘要
预测市场如 Polymarket 将众多信念聚合为实时概率估计,市场下方的评论包含丰富的方向立场信号,这些信号无法被价格alone 捕获。本工作引入了首个应用于预测市场评论的立场检测研究,这一领域以极端简洁性、交易者特定的口语以及严重的类别不平衡(只有 8.7% 的评论反对市场结果)为特征。我们在 4x3 交叉实验中微调 RoBERTa-base:四种输入配置({2 类别、3 类别} x {是否包含市场上下文})和三种增强条件(基线、50% 人造、100% 人造)。通过 Anthropic API 生成的 LLM 驱动的 Pro -> Anti 反事实翻转用于生成少数类样本。结果表明:(1) 市场上下文是最具影响力的因素,将 3 类别 Anti recall 从 0.10 提升至 0.45; (2) 反事实数据增强在弱配置中有效(0.10 -> 0.24),但在强配置中效果下降(2 类别-上下文 macro F1: 0.68 -> 0.50 在完全剂量下); (3) 50% 增强剂量最为理想,100% 剂量始终损害性能。基于注意力的可解释性分析为所有三项发现提供了机制性支持。
引用
@article{arxiv.2605.28745,
title = {Stance Detection in Prediction Markets: Addressing Imbalanced Trader Commentary via Counterfactual Augmentation and Market Context},
author = {Thomas Mbrice},
journal= {arXiv preprint arXiv:2605.28745},
year = {2026}
}
备注
14 pages, 9 figures