转换都做了哪些处理
- 删除
<script>、<style>与注释,避免把代码当正文。 - 把
<br>与块级标签的结尾当作换行;关闭「保留段落换行」则合并为一行。 - 可选给
<li>加-前缀,让列表在纯文本里也清晰。 - 解码
、&、'等 HTML 实体。
常见问题
转换结果里的多余空格能去掉吗?
开启「保留段落换行」时,工具会顺手压缩行尾空白并把连续空行合并为一行空行;关闭时则把全部空白折叠成单空格,得到一行连续文本。
能处理整页 HTML 吗?
可以,但请先粘贴源码而不是网址——本工具不联网抓取,只处理你粘贴进来的内容。整页抓下来的源码通常包含大量导航与脚本,转换后需自行取舍。
为什么结果里出现了 < 这样的字符?
那是被转义后的文本(原文是 <)。工具解码实体后,若结果本身包含尖括号,会按纯文本原样输出,这是正确行为,不会被执行。
怎么用
- 把网页源码或富文本粘贴进左侧输入框
- 点转换按钮
- 右侧直接得到去掉标签的纯文本,段落换行保留
- 点复制按钮拿走结果
适用场景
- 从新闻页扒正文,去掉一堆嵌套标签和样式
- 把邮件里的 HTML 内容整理成纯文本存档
- 给大模型喂资料前,先清洗成干净文字
- 导入笔记软件时避免残留标签影响排版
注意事项
- script 和 style 标签连同内部代码会被整段丢弃,只保留正文可见文字。
- 图片、视频这类非文字元素会直接消失,链接只留显示文字,不保留网址。
- 表格会被压成一行行文字,单元格之间用空格分隔,看起来对不齐是正常现象。
- 连续空格和制表符可能残留,需要更干净的版本可再用文本工具压缩空白。
- 转换在浏览器本地进行,粘贴的源码不会离开你的电脑,刷新页面内容即清空。