单向论点能否导致大型语言模型的响应改变?
计算与语言
2026-02-09 v1 人工智能
摘要
论争性问题需要超过一个观点才能表达平衡的答案。大型语言模型(LLMs)可以提供平衡的答案,但也会采取单一的对齐观点或拒绝回答。本文我们研究此类初始响应能否通过仅提供支持该观点的单向论点以一种简单直观的方式被引导到特定观点。我们的系统性研究有三个维度:(i)LLM响应诱导什么立场,(ii)论争性问题如何被表述,(iii)论点如何呈现。我们构建了一个小型数据集,惊人地发现,在(i)-(iii)的各种组合下,包括不同模型、论点数量和主题方面,都发生了意见引导。切换到其他论点可一致地降低意见引导。
引用
@article{arxiv.2602.06260,
title = {Can One-sided Arguments Lead to Response Change in Large Language Models?},
author = {Pedro Cisneros-Velarde},
journal= {arXiv preprint arXiv:2602.06260},
year = {2026}
}