基于大语言模型的文本数据人类价值高效识别框架 EAVIT
计算与语言
2025-05-20 v1
摘要
大语言模型(LLM)的快速发展彻底改变了各个领域,包括从文本数据中识别和发现人类价值。虽然传统 NLP 模型如 BERT 曾被用于此任务,但其代表文本数据的能力远远不如新兴的大型生成模型(如 GPT)。然而,面向长上下文处理的在线 LLM 性能常会下降,而且还会产生巨大的计算成本。为此,我们提出 EAVIT(Efficient and Accurate Human Value Identification from Text data via LLMs),一个高效且准确的人类价值识别框架,融合了本地可微调模型与在线黑盒 LLM 的优势。我们的框架采用价值检测器——一个小型本地语言模型——生成初始价值估计。这些估计被用于构建简洁的输入提示,供在线 LLM 使用,以实现准确的最终价值识别。为训练价值检测器,我们针对价值识别任务引入解释驱动的训练和数据生成技术,同时采用采样策略优化 LLM 输入提示的简洁性。我们的方法有效地将输入标记数量降低了最高可达 1/6,同时持续优于传统 NLP 方法和其他基于 LLM 的策略。
引用
@article{arxiv.2505.12792,
title = {EAVIT: Efficient and Accurate Human Value Identification from Text data via LLMs},
author = {Wenhao Zhu and Yuhang Xie and Guojie Song and Xin Zhang},
journal= {arXiv preprint arXiv:2505.12792},
year = {2025}
}