风险场景2026-09-11·Digital Footprint Health Team
AI 正在用你的旧帖训练:你能做的和做不到的
AI 训练数据抓取内容授权隐私
如果你多年来一直公开发帖,就假设自己的文字已经被收集过。对公开网页与社交内容的大规模抓取早已是常规做法,而收集到的数据通常不会因为内容后来消失而被重新抓取并剔除。这不代表无事可做——而是说真正有效的动作比多数建议所暗示的要窄。
「用你的帖子训练」到底指什么
两件被混为一谈的事:
- 收集——爬虫把你的公开文字复制进数据集。这已经发生了。
- 影响——模型的权重受到这些文字影响。这是弥散的;没人能在模型里指出你的那条推文。
正因为影响是弥散的,个体的退选请求无法精准移除你的贡献。但「收集」是仍在持续、且你今后还能影响的那一部分。
你实际能做的
1. 控制未来的抓取
如果你拥有网站,用 robots.txt 禁止公开了 user agent 的主流 AI 爬虫是有效的。社交平台上的帖子你不掌控这一层——由平台决定。
2. 缩小公开面
保持公开的文字越少,下一季度可被抓取的内容就越少。这正是审计清单的用途。它是预防性的,不是补救性的。
3. 提交已有的退选表单
几家主要实验室都发布了个人数据的退选机制。值得提交,但要有合理预期:它们影响未来收集、有时影响未来模型版本,而不是已经发布的那些。
4. 对可识别输出申请移除
如果模型直接输出了你的手机号、住址或私密内容,那是与「我的观点在训练集里」完全不同、也强得多的主张。针对这种具体情形走服务商的移除流程。
不起作用的做法
- 为了「从模型里移除」而删帖——副本早已制作完成。
- 在简介里加版权声明——它不是技术控制手段。
- 以为改为私密账号能让既有数据集回溯性隐藏旧公开帖。
务实的框架
把公开发帖当成在会议上发言:它会被记录,而且无法收回。目标不是移除已经在外面的内容,而是确保你未来十年的公开写作,是你乐意被引用的内容。
常见问题
能把自己的数据从已训练模型里移除吗?
没有可靠方式。机器遗忘仍是活跃的研究问题,不是今天能申请的服务。
删掉账号有用吗?
它能阻止该账号未来被收集,但无法撤销过去的抓取。
这构成不发帖的理由吗?
不构成——它构成的是:以你对待任何永久公开媒介的同样判断力去发帖。
结论
收集已经完成,影响是弥散的,而未来抓取才是你还能左右的部分。把力气花在那里,而不是追逐不可能的反转。
检查你自己的 X/Twitter 数字足迹
免费本机扫描,你的归档永不离开电脑。
免费开始体检