中文

CAST:实现 LLM 基于文本分析的数据分析稳定性

计算与语言 2026-04-23 v2 人工智能

摘要

基于表格数据进行文本分析依赖两个核心操作:概要化用于从整体层面提取主题,标记用于对行级标签进行标注。大型语言模型(LLM)用于这些任务的一个关键限制是其无法满足数据分析所需的高输出稳定性标准。为此,我们引入了 CAST(Consistency via Algorithmic Prompting and Stable Thinking),一个通过约束模型潜在推理路径来提升输出稳定性的框架。CAST 结合(1)算法化提示,以对有效推理过渡施加程序化框架,和(2)构建式思考,强制在最终生成之前进行明确的中间承诺。为衡量进展,我们引入了 CAST-S 和 CAST-T,分别用于衡量带项目概要化和标记的稳定性,并验证其与人类判断的一致性。实验在多个公开基准上进行,覆盖多种 LLM 主干模型,结果显示 CAST 在所有基线中始终实现最佳稳定性,提升最高可达 16.2% 的稳定性得分,同时保持或提升输出质量。

关键词

引用

@article{arxiv.2602.15861,
  title  = {CAST: Achieving Stable LLM-based Text Analysis for Data Analytics},
  author = {Jinxiang Xie and Zihao Li and Wei He and Rui Ding and Shi Han and Dongmei Zhang},
  journal= {arXiv preprint arXiv:2602.15861},
  year   = {2026}
}

备注

ACL 2026 Findings