人类对AI偏见的目标视角 vs 真相遗漏
综合金融
2026-05-07 v2 人工智能
摘要
本研究探讨了人类定义的目标如何通过目的条件化认知影响大型语言模型(LLM)的行为。我们使用金融预测任务,展示了在揭示LLM输出的下游用途(例如预测股票回报或盈利)后,LLM会生成偏向的情感和竞争措施,尽管这些措施本意上是与下游任务无关的。目标感知提示会将这些中间措施向披露的下游目标倾斜,导致样本内过拟合。具体而言,目的泄漏在LLM知识截止日期之前的数据上提高性能,但在截止日期之后没有优势。这种偏见的强度足以让正则化提示指令无法完全解决这一形式的过拟合。我们进一步表明,这种偏见可能源于用户无意中的对话背景,这些背景暗示了目的。总体而言,我们记录了AI偏见由于“看到目标”而并非算法缺陷,而是源于研究设计中的人类责任。
引用
@article{arxiv.2602.09504,
title = {Seeing the Goal, Missing the Truth: Human Accountability for AI Bias},
author = {Sean Cao and Wei Jiang and Hui Xu},
journal= {arXiv preprint arXiv:2602.09504},
year = {2026}
}
备注
24 pages, 4 figures, 8 tables