LinGO:面向联合语言模型的语言图优化框架,用于解释不文明话语的意图
摘要
检测不文明语言对于维持安全、包容且民主的线上空间至关重要。然而,现有的分类器常常误解包含不文明线索但表达文明意图的帖子,导致对线上有害不文明现象的估计被高估。我们引入LinGO,这是一个面向大语言模型(LLM)的语言图优化框架,利用语言结构和优化技术来分类使用各种直接和间接表达的不文明意图的多类别意图。LinGO将语言分解为多步骤语言组件,识别导致大多数错误的目标步骤,并迭代优化提示和/或示例组件以针对性地优化这些步骤。我们使用2022年巴西总统大选期间收集的数据集进行评估,涵盖四种政治不文明形式:不文明(Impoliteness, IMP)、仇恨言论与刻板印象(Hate Speech and Stereotyping, HSST)、身体伤害与暴力政治修辞(Physical Harm and Violent Political Rhetoric, PHAVPR)以及对民主制度与价值的威胁(Threats to Democratic Institutions and Values, THREAT)。每个实例都标注了六种文明/不文明意图类型。我们使用三个高效大语言模型:GPT-5-mini、Gemini 2.5 Flash-Lite和Claude 3 Haiku,对LinGO进行基准测试,并使用四种优化技术:TextGrad、AdalFlow、DSPy和检索增强生成(RAG)。结果显示,在所有模型中,LinGO相对于零-shot、链式思考、直接优化和微调基线测试, consistently提高了准确率和加权F1分数。RAG是最强的优化技术,当与Gemini模型搭配使用时,实现了最佳的整体性能。这些发现表明,将多步骤语言组件纳入大语言模型指令中并针对性地优化这些组件,可以帮助模型解释复杂语义含义,这可以延伸至其他复杂语义解释任务。
引用
@article{arxiv.2602.04693,
title = {LinGO: A Linguistic Graph Optimization Framework with LLMs for Interpreting Intents of Online Uncivil Discourse},
author = {Yuan Zhang and Thales Bertaglia},
journal= {arXiv preprint arXiv:2602.04693},
year = {2026}
}