Skip to content

当 Agent 把你的聊天记录编译成一个可以转卖的“你”

封面

过去,AI 产品说“记住你”,通常意味着在数据库里保存几条偏好:你喜欢简洁回答、常用 Python、不吃香菜。

现在出现了另一条路线:系统不再每次检索这些记忆,而是把长期聊天记录蒸馏成一个 Persona Skill(人格技能)——一组可以被 Agent 直接调用的规则,里面不仅有你知道什么,也有你如何判断、如何表达、如何修正别人。

这两种设计的风险完全不同。

聊天记录是关于你的数据;Persona Skill 是一个可以代替你表现的数据制品。

它可以被安装到不同 Agent,跨任务重复使用,甚至作为独立技能包分发。论文和开源系统已经明确讨论“可移植”“可安装”和“受控分发”;公开证据尚不能说明市场正在大规模买卖真人技能,但一旦人格被制成可转移制品,交易只剩商业规则问题,不再是技术问题。

这意味着 AI 平台未来最值钱的用户资产,可能不再是聊天原文,而是从聊天中编译出的“行为副本”。

一、从记忆到技能,发生了什么变化

传统 Agent 记忆大致是一个检索过程:

当前任务 → 搜索相关历史 → 把几条记录放进上下文 → 生成回答

Persona Skill 则先做一次蒸馏:

大量历史交互 → 提取稳定规律 → 生成技能包 → 供多个 Agent 持续调用

这种技能包可能包含两类内容:

  • 能力轨道:你常用的工作方法、判断标准、领域经验和决策启发;
  • 行为轨道:你的表达风格、互动边界、纠错方式和惯常偏好。

COLLEAGUE.SKILL 把这类制品设计成可检查、可修订、可回滚、可跨 Agent 主机安装的版本化技能包。这对产品非常有吸引力:用户不必在每个新 Agent 上重新磨合,企业也能把专家经验迁移给团队。

但压缩改变了隐私的形态。原本散落在数千轮对话中的信号很难一次看全;蒸馏器却主动替潜在使用者完成了汇总、归纳和结构化。

它把低密度的行为痕迹,变成了高密度的身份资产。

二、最多 66.2% 的“你”留在技能里

8 月发布的论文《When Agents Learn to Be You》提出 AntiSkillBench,专门测试 Persona Skill 的隐私泄露和冒充风险。

研究者构造了 50 个包含人口属性、背景、Big Five 人格和沟通风格的模拟用户。每个用户生成 50 个问题,再扩展成三轮对话,共得到 2500 条对话轨迹、7500 轮用户发言。随后使用三种蒸馏方法,在 GPT 5.4、Gemini 3.6 Flash 和 Claude Haiku 4.5 上测试。

论文区分了三种风险:

指标测量的问题最高结果
Skill Coverage技能包保留了多少人格信息66.2%
Field QA Accuracy装入技能的 Agent 能否回答关于用户的属性问题56.0%
VocabGainAgent 的表达能在多大程度上接近目标用户87.7%

最高风险出现在沟通风格。GPT 5.4 的三阶段蒸馏保留了 92.0% 的沟通信息;装入技能后,Agent 对沟通属性问题的回答准确率达到 75.9%,沟通维度的 VocabGain 达到 87.7%。

这比泄露姓名或职业更值得警惕。

姓名需要被问出来,语气却会自行出现。一个人的句式、口头禅、礼貌程度、论证节奏和处理分歧的方式,本身就是行为指纹。Agent 不必宣称“我是某某”,只要在邮件、群聊和审批意见中持续表现得像他,就可能让接收者误判信息来源。

图 1:Persona Skill 把分散的聊天信号压缩成可读取、可安装的身份制品。

这组数据来自模拟人格和合成对话,不是真实用户泄露率;模拟角色也可能比普通人具有更鲜明的风格。因此,87.7% 不能直接外推为现实攻击成功率。

但三个模型、三种蒸馏方法都出现相同方向的风险,说明问题不只是某个产品写坏了隐私模块,而是蒸馏目标本身存在矛盾:系统越擅长提炼“什么使你成为你”,越可能产出一个可被他人利用的你。

三、删除聊天记录,为什么不等于删除“你”

隐私治理过去围绕原始记录设计。

用户可以要求删除聊天、撤销某个应用的访问权限,平台可以对姓名、电话和地址做脱敏。这些办法都假设风险对象仍是一条条记录。

Persona Skill 打破了这个假设。

如果原始聊天已经被蒸馏成一组规则,那么:

  • 删除对话,不会自动删除技能中的推断;
  • 隐去姓名,不会移除性格和表达习惯;
  • 撤销一个 Agent 的权限,不会撤销已经复制到其他主机的技能;
  • 修改某条事实,不会自动修正所有历史版本;
  • 技能包即使没有明确身份字段,也可能通过行为模式指向同一个人。

这与训练模型后的“机器遗忘”问题相似,但更容易传播。大模型参数通常由平台控制,Persona Skill 却被设计成小型、便携、可部署的制品。复制成本接近于零,撤回则需要知道副本去了哪里。

因此,Persona Skill 不应只被视为用户配置或缓存。它更接近一种 身份衍生物:由个人数据推导而来,可以代表个人行动,但不再等同于任何一条原始数据。

四、现有防御为什么只解决表面

AntiSkillBench 测试了隐私中和改写、事后对抗混淆和语义后门水印等防御。

效果最好的是在对话进入历史记录前,把用户问题改写成隐私中性的表达。以 GPT 5.4 的直接蒸馏为例,沟通风格 VocabGain 从 87.3% 降至 6.5%。

但代价也很明显:系统首先抹掉的,正是个性化最容易感知的部分。更深层的人格与背景仍然大量保留,隐私改写后人格信息的 Skill Coverage 仍为 70.0%。

水印同样不可靠。语义后门在直接蒸馏中可以较好地保留静态检测信号,但换成更强调人格抽象的 Colleague Distill 后,检测效果明显下降。蒸馏器可能把水印当成另一种行为特征重新解释,甚至在压缩过程中将其洗掉。

这暴露了一个根本冲突:

脱敏希望去掉能识别你的信号,个性化却希望尽可能准确地保留这些信号。

仅靠更聪明的脱敏算法,很难同时把两件事都做到极致。真正有效的治理必须限制技能能去哪里、能做什么,而不只是修改技能里写了什么。

五、谁拥有被编译出来的“你”

一旦 Persona Skill 可以跨平台迁移,它就会产生新的产权问题。

训练一个了解用户的 Agent 需要数月互动。这个过程由用户持续提供反馈,由平台承担计算和产品成本,最终形成的技能却可能同时包含三种价值:

  1. 用户的个人数据和行为特征;
  2. 平台的蒸馏方法与工程投入;
  3. 可供其他 Agent 使用的生产能力。

平台会自然地把它视为提高留存率和服务质量的资产;用户则有理由认为,任何可以模仿自己并代表自己行动的制品都不应脱离本人控制。

所以,Persona Skill 的治理不能停留在一张“同意个性化”的复选框。至少需要回答:

  • 生成前:哪些对话允许参与蒸馏,是否得到单独同意;
  • 生成后:用户能否查看、修改、导出和彻底删除技能;
  • 调用时:技能只能提供建议,还是可以发邮件、签合同和批准付款;
  • 迁移时:接收方是谁,目的是什么,能否再次转移;
  • 退出时:所有副本、缓存和历史版本能否被统一撤销;
  • 审计时:某次输出由哪个 Persona Skill、哪个版本和哪个授权触发。

NIST 2026 年的 AI Agent 标准计划已经把 Agent 身份、授权和可审计性列为重点。但 Persona Skill 还提出了更难的一层:不仅要证明“这个 Agent 是谁”,还要证明“它此刻代表谁,以及这种代表是否仍然有效”。

结论

让 Agent 长期理解用户,本身没有错。真正危险的是,产品把“理解”实现为一个可复制、可安装、可执行的人格制品,却仍沿用聊天记录时代的隐私规则。

聊天记录泄露,暴露的是你说过什么,那是一份信息副本。

Persona Skill 泄露,暴露的可能是你会怎么说、怎么选、怎么行动,那已经接近一个可以替你行动的代理。

当“你”能够被编译成技能,隐私权就不能只包括删除原始数据,还必须包括撤销由这些数据生成的你。

如果用户不能知道这个技能是否存在、不能检查其中的推断、不能限制它的权限,也不能让所有副本失效,那么所谓“个性化”实际上完成了一次产权转移:平台获得了一个可持续工作的数字人格,用户只获得了更顺手的回答。

这才是 Persona Skill 真正的商业价值,也是它最需要被治理的风险。

参考资料

  1. Yongli Xiang 等,《When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills》,arXiv:2608.03700,2026 年 8 月。https://arxiv.org/abs/2608.03700
  2. 《AntiSkillBench 项目页》。https://yonglixiang.github.io/AntiSkillBench
  3. 《COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation》,arXiv:2605.31264,2026 年。https://arxiv.org/abs/2605.31264
  4. Ground Truth,《A portable persona skill carried one user's verbal tics into unrelated conversations》,2026 年 8 月 5 日。https://groundtruth.day/news/a-persona-skill-carried-one-users-verbal-tics-into-unrelated-chats.html
  5. NIST,《AI Agent Standards Initiative》,2026 年 2 月 17 日发布,8 月 14 日更新。https://www.nist.gov/artificial-intelligence/ai-agent-standards-initiative

本文部分内容由 AI 辅助生成,经人工审校和补充后发布。