基于提示的清晰度评估与政治问答中的主题检测
计算与语言
2026-01-14 v1 人工智能
摘要
大语言模型(LLM)响应的自动评估不仅需要事实正确性,还需要清晰度,尤其是在政治问答中。虽然最近的数据集提供了清晰度和回避的人工标注,但提示设计对自动清晰度评估的影响仍未得到充分探索。在本文中,我们使用SemEval 2026共享任务中的CLARITY数据集研究基于提示的清晰度评估。我们将数据集提供的GPT-3.5基线与在三种提示策略下评估的GPT-5.2进行比较:简单提示、思维链提示以及带少量样本的思维链提示。模型预测通过准确率和针对清晰度与回避的类别级指标以及层次精确匹配与人工标注进行比较。结果表明,GPT-5.2在清晰度预测上始终优于GPT-3.5基线,在带少量样本的思维链提示下,准确率从56%提高到63%。思维链提示在回避准确率上达到最高34%,尽管在细粒度回避类别上的改进不太稳定。我们进一步评估了主题识别,发现基于推理的提示将准确率从60%提高到74%(相对于人工标注)。总体而言,我们的发现表明,提示设计可靠地改进了高层级清晰度评估,而细粒度回避和主题检测尽管使用了结构化推理提示,仍然具有挑战性。
引用
@article{arxiv.2601.08176,
title = {Prompt-Based Clarity Evaluation and Topic Detection in Political Question Answering},
author = {Lavanya Prahallad and Sai Utkarsh Choudarypally and Pragna Prahallad and Pranathi Prahallad},
journal= {arXiv preprint arXiv:2601.08176},
year = {2026}
}
备注
6 pages, 6 tables