隐私指南··Digital Footprint Health Team
归档文件里到底有什么?tweets.js 大揭秘
X(Twitter)数据归档解压后你会看到一堆文件,但真正藏着你全部隐私痕迹的是 tweets.js。这篇把它彻底拆开:里面长什么样、每个字段什么意思、以及为什么隐私体检只看它就够。
tweets.js 是什么
它是 X 官方导出的全部推文的结构化数据,格式是 JavaScript 赋值语句:window.YTD.tweets.part0 = [ ... ],括号里是一个数组,数组里每个对象代表一条推文。隐私体检工具就是解析这个数组。
每条推文里有什么
- created_at——发布时间(UTC 字符串,例如 "Fri Jan 15 02:45:00 +0000 2010")
- full_text——推文全文,手机号、邮箱、住址等风险内容主要藏在这里
- entities——URL、媒体、提及的结构化引用(截图里的网址也在此)
- id_str——推文唯一 ID,删除操作按它定位
- retweeted_status / in_reply_to_status_id——转发、回复的关联信息
为什么它支撑隐私体检
体检原理很简单:逐条扫描 full_text 和 entities,用正则与规则匹配手机号、邮箱、地址、定位和敏感话题,给每条推文打风险标签(phone/address/location/sensitive),再汇总成 0-100 健康评分。整个过程在你本机完成,tweets.js 不出你的电脑。
归档里还有哪些文件
- data/ 目录——图片、视频、头像等媒体(不影响文本扫描)
- account.js——账号资料(用户名、创建时间、邮箱前缀掩码)
- following.js / follower.js——关注与被关注列表
- direct-messages.js——私信(同样含敏感内容)
常见问题(FAQ)
tweets.js 能直接打开看吗?
可以,但建议用工具解析——文件可能几 MB 到几十 MB,人眼翻不完。交给数字足迹体检,几分钟出结果。
tweets.js 包含已删除的推文吗?
包含你删除之前的推文。归档是你账号在导出时刻的快照,已删推文若在导出前删掉就不在内;但更早的、平台 3,200 条限制之外的历史推文,这里都有。
只上传 tweets.js 够吗?
够。隐私体检的核心是文本扫描,tweets.js 包含全部文本与 URL;媒体文件不参与扫描。