中文

基于结构化合成数据生成与抽象 n-gram 关联的大型语言模型输出中语言表征的对比分析

计算与语言 2026-04-21 v1

摘要

我们提出一种方法ological 框架,通过对比式合成文本生成和统计分析来发现与不同社交群体相关的语言和叙事模式。与先前方法不同,我们旨在刻画细微的偏见表达,而非通过预先确定的词汇或表达列表来诊断偏见。我们还在上下文化数据上工作,而非孤立的词汇或句子。该方法ological 可用于任何语料类型,涵盖叙事性、任务导向或对话性文本。通过控制情境情景与群体标记的组合,生成上下文化数据,创建仅在所指群体上有所差异、且在可比叙事条件下保持一致的最小配对文本。为便于稳健分析,语言形式被抽象化,并通过一种点互信息变体来量化语言抽象与群体之间的关联,以检测在不同群体中出现比例显著高于常规的表达。随后采用分段排名策略优先处理高浓度偏见语言信号的文本片段,这使得专家能够在语境下评估语言表达的有害潜力,桥接定量分析与定性解释。

关键词

引用

@article{arxiv.2604.17398,
  title  = {Contrastive Analysis of Linguistic Representations in Large Language Model Outputs through Structured Synthetic Data Generation and Abstracted N-gram Associations},
  author = {S. A. Desimone and L. Alonso Alemany},
  journal= {arXiv preprint arXiv:2604.17398},
  year   = {2026}
}