中文

YNTP-100:基于 100 位用户的下一令牌预测基准

计算与语言 2026-01-29 v3

摘要

为通用\textit{next-token prediction} 训练的大语言模型(LLM)常常难以生成反映特定个体沟通方式的响应。个人化对齐进展受限于由于隐私限制难以收集真实世界个人通信数据的难题。我们提出 Your Next Token Prediction(YNTP),将个性化响应生成形式化为以用户交互历史为条件的 token 级预测任务。我们引入\textbf{YNTP-100},一个来自 100 位用户的多语言多日人类--智能体对话中构建的基准,旨在系统评估用户特定的响应行为。我们使用 substance similarity 和 stylistic consistency 等指标评估外部(参数保持)和内部(参数更新)对齐方法。该数据集和结果已公开于:https://github.com/AnonymousHub4Submissions/YNTP100。

关键词

引用

@article{arxiv.2510.14398,
  title  = {YNTP-100: A Benchmark for Your Next Token Prediction with 100 People},
  author = {Shiyao Ding and Takayuki Ito},
  journal= {arXiv preprint arXiv:2510.14398},
  year   = {2026}
}