返回博客
归档技术2026-08-18·Digital Footprint Health Team

归档 200MB、3 万文件?大归档也能在本机处理

X/Twitter数据归档大文件本机处理

老账号导出的 X 大归档动不动就 200MB、解压后 3 万个文件,扔进在线工具十次有八次转圈到崩。这不是你的账号有问题,是很多工具压根没为这个量级设计过。这篇把大归档的构成拆开讲清楚:体积从哪来、哪些文件真的有用、浏览器扛不扛得住、报错怎么修。

200MB 归档里到底装了什么

先看一份真实的 203MB 归档解压后的分布,账号是 3.2 万条推文、十年历史:

目录/文件体积文件数有没有用
data/tweets.js38MB1核心,全部推文正文和 ID 都在这
data/ 其余 js约 6MB60 多个关注、点赞、DM 等,体检一般不用
data/tweets_media/约 150MB2.6 万+图片和视频缩略图,按需读取
assets/ + Your archive.html约 9MB数百官方的本地浏览界面,纯展示

看到这个分布就明白了:真正需要解析的只有 38MB 的一个文件,剩下 150MB 是图片。任何把整个 ZIP 一口气读进内存的工具,都是在给自己找麻烦。tweets.js 的具体结构我在归档里的 tweets.js 是什么里逐字段拆过。

体积到底从哪来

三个来源,权重差得很远。图片和视频是绝对大头,X 会为一张图生成好几个尺寸,一条四图推文对应十几个文件很常见。其次是转推和长回复,虽然是纯文本,但每条都带完整的元数据 JSON,3 万条堆起来也有几十 MB。最后是 DM 记录,如果你有多年活跃的私聊,这部分能单独占几十 MB。

所以文件数和推文数不成正比。我见过 8000 条推文导出 1.2GB 的账号,因为那人常发视频;也见过 4 万条推文只有 31MB 的,纯文字冷冰冰。别用体积判断自己账号"脏不脏"。

浏览器能不能扛住 3 万文件

能,前提是工具知道自己在干什么。现代浏览器处理 ZIP 的能力比大部分人以为的强,卡死通常来自两个坏实现:一次性把所有文件解压到内存,或者对每个媒体文件都建 DOM 节点做预览。

正确的做法很朴素——只解压 data/tweets.js,流式解析,媒体文件等你点开某条推文时再按需取。这样一份 203MB 的归档,实测内存峰值不到 400MB,解析 3.2 万条用了 2 分 12 秒。我自己的老笔记本(16G 内存)跑得动,不需要什么高配。

还有个附带好处:只在本机解析意味着这 200MB 一个字节都不用上传。上传 200MB 到别人服务器,慢是小事,你把十年私聊和定位交出去了才是大事,这点我在为什么坚持本机解析里说得更细。

大归档常见的三类报错

解压失败或提示文件损坏。八成是下载没下完。X 的下载链接有有效期,断线续传经常出问题,最稳的办法是重新申请一份,用有线网络一次下完,下完先看文件大小对不对。

页面卡死或标签页崩溃。换个工具试试,这是实现问题不是你的问题。也可以先手动解压 ZIP,只把 data 目录喂进去,绕开媒体文件。

解析出来的推文数不对。先确认是不是漏读了分卷。推文特别多的账号,tweets.js 会被拆成 tweets-part1.js、tweets-part2.js,只读第一个就会少一半。这是我见过最常见的静默错误。

大归档处理的实操建议

  • 下载后立刻复制一份到移动硬盘,归档链接过期就得重新等三天
  • 先只看 data 目录,媒体文件晚点再管
  • 核对推文总数和你 profile 上显示的数量,差得多说明漏读了分卷
  • 解压路径别放太深,Windows 的 260 字符路径限制会让某些媒体文件解不出来
  • 处理完不要急着删 ZIP,它就是你的账号快照

FAQ

X 归档最大能有多大? 没有硬性上限。纯文字老账号可能 20-40MB,图片视频多的能到几个 GB。我见过最大一份 4.1GB,视频占 3.7GB。

浏览器能处理 200MB 的归档吗? 能,但要看实现。只解析 data/tweets.js、媒体按需读取的话,200MB 归档内存占用能压在几百 MB 以内。

为什么我的归档里文件这么多? 绝大多数是媒体缩略图。X 为每张图生成多个尺寸,真正装推文数据的只有 data 目录下几十个 js 文件。

大归档解析慢怎么办? 先分清瓶颈在解压还是解析。3 万条正常 2-3 分钟出结果,超过十分钟大概是工具实现有问题。

归档已经躺在硬盘里了?拖到 digital-footprint-health.shop 跑一次免费体检,几分钟就知道这十年里哪些内容该清。还没导出的话,先看如何下载 X 数据归档

常见问题

X 归档最大能有多大?

没有硬性上限,取决于你发过多少内容。纯文字的老账号可能只有 20-40MB,发过大量图片和视频的能到几个 GB。我见过最大的一份是 4.1GB,其中视频占了 3.7GB。

浏览器能处理 200MB 的归档吗?

能,但要看实现。归档解压后是几万个小文件,如果工具傻乎乎地一次全读进内存,标签页会崩。正确做法是只解析 data/tweets.js 这一个文件,媒体文件按需读取,这样 200MB 的归档内存占用能压在几百 MB 以内。

为什么我的归档里文件这么多?

绝大多数是媒体缩略图。X 会为每张图生成多个尺寸,一条带四图的推文可能对应十几个文件。3 万文件听着吓人,实际里面真正装推文数据的只有 data 目录下的几十个 js 文件。

大归档解析慢怎么办?

先确认瓶颈在解压还是解析。解压慢是磁盘问题,换到 SSD 或者先手动解压再处理。解析慢通常是工具在做正则全文扫描,3 万条正常应该在 2-3 分钟内出结果,超过十分钟大概率是实现有问题。

检查你自己的 X/Twitter 数字足迹

免费本机扫描,你的归档永不离开电脑。

免费开始体检

相关阅读

发布于 2026-08-18,最后更新于 2026-08-18。