把 The Making of Claude Code 抓进终端里读
· 阅读约 2 分钟
今天想读 Anthropic 发的那篇 The Making of Claude Code,网页上看了两段就烦了,把它抓下来放进终端里读。这篇笔记记的是完整流程:抓 HTML、转纯文本、解决代码块宽度、顺手清掉链接列表——都是以后会反复用到的操作。
页面地址是 https://www.anthropic.com/features/making-of-claude-code。第一步先把 HTML 抓下来:
curl -s https://www.anthropic.com/features/making-of-claude-code -o making-of.html
拆开看看这份 HTML。我第一次没动脑子,直接用 sed 把标签全扒了:
sed 's/<[^>]*>//g' making-of.html > making-of.txt
结果正文是出来了,但 <pre> 里的代码缩进跟着标签一起没了,行宽也完全失控——超过 80 列的内容沿窗口边缘折下去,根本没法读。这条路线放弃,换 lynx:
lynx -dump -nolist -width=200 making-of.html > making-of.txt
关键在 -width=200 和 -nolist 这两个参数。-width 决定转换时按多少列折行,默认 80 太窄,网页正文一行通常超过这个数,折了之后代码和表格就全废了;-nolist 是关掉 lynx 在文末输出的那一串 [1][2][3] 链接索引,纯文本阅读下那是纯噪音。
然后放进 less:
less -S making-of.txt
这里有个坑:-width 只解决了转换时的折行,less 自己默认也会软换行——终端窗口有多少列,它就折到多少列,代码照样断。要加 -S 关掉自动换行,超宽的行改成横向滚动。这个我也是第二次才想起来,第一次在 lynx 那边加了宽度,打开 less 一看还是乱的,愣了几秒才反应过来问题出在谁头上。
💡 小技巧:习惯用 vim 的话,对应的是 :set nowrap,效果一样。
链接这块再记一笔。去掉文末链接列表之后,正文里偶尔还会冒出一两个裸 URL,读着有点硌眼。实在在意的话,可以再补一条 sed 把 http 开头的行清掉,不过大部分文章的正文链接都不多,我就留着没动。
划重点:第一,网页文章转纯文本,直接用 lynx -dump,别用 sed 硬扒标签,缩进和结构它都会替你保留好;第二,代码宽度要管两个地方——转换时的 -width 和阅读器里的 -S,漏掉任何一个都等于白弄;第三,链接列表先用 -nolist 关掉,多半不亏。这个流程我存进笔记了,下次遇到想收进终端的长文直接照搬。
哦对了,页面本身其实带一个"在终端中阅读"的模式,排得挺认真。不过我还是会自己抓一份——抓过一遍才知道这份文本里哪几块是真代码,哪些是装饰性链接,这个底细,亲手跑一遍比较踏实。
评论
还没有评论,写下第一条讨论。