跳到主要内容

文档脱敏

自动识别并打码敏感信息

识别哪些信息
姓名识别增强(误报会变多)
自定义正则(可选)

内部工号、订单号这类自家格式,可以自己写一条规则。

脱敏方式
命中 13 处姓名 6手机号 1邮箱 1统一社会信用代码 2住址 1车牌号 1IP 地址 1
命中明细(13 条)
类型脱敏后
姓名户***
姓名张*
姓名系**
手机号138****5678
邮箱zh******@example.com
统一社会信用代码11************123X
姓名货**
住址北京市朝阳区********************
姓名代*
统一社会信用代码91************CD2X
姓名公**
车牌号京A****5
IP 地址192.*.*.24

全部处理在你的浏览器本地完成,文档内容不会上传到任何服务器,这也是它和在线 API 类脱敏服务最本质的区别。识别靠正则与校验位(身份证校验位、银行卡 Luhn), 漏报和误报都可能存在,正式外发前请人工过一遍。

文档脱敏是什么

文档外发前要抹掉个人信息,人工一个个找既慢又容易漏。做法是先用规则批量识别,再按需要选择打码强度。

这个工具能做什么

  • 识别十三种敏感信息:姓名、手机号、身份证、银行卡、邮箱、住址、IP、车牌、统一社会信用代码、护照、QQ、微信、座机
  • 四种打码方式:保留首尾、全部打码、换类型标签、换稳定代号
  • 身份证校验位与银行卡 Luhn 双重校验,压低误报
  • 支持白名单、姓名识别增强与自定义正则

怎么使用(输入说明)

  1. 粘贴文本或导入 txt / csv / json 文件
  2. 勾选要识别的类型,按需加自定义规则
  3. 选打码方式,看命中统计
  4. 复制或下载脱敏后的文本

使用时的几个注意点

  • 命中明细默认不显示原文,避免二次泄露
  • 姓名识别增强会提高召回但也增加误报
  • 「换成稳定代号」模式适合还要做关联分析的场景

实例

一份客户登记表,识别出姓名 1 处、手机号 1 处、身份证 1 处、住址 1 处,保留首尾模式输出为 张*、138****5678、110101********123X。

常见问题 FAQ

Q:文档会上传到服务器吗?

A:不会。整个识别与打码过程都在你的浏览器里完成,文档内容一步都没有离开设备。这是它和在线 API 类脱敏服务最本质的区别,处理合同、名单、病历都可以放心。

Q:识别准吗?会漏吗?

A:手机号、邮箱这类格式固定的识别率很高;身份证会验校验位、银行卡会验 Luhn,误报很少。但姓名、住址靠正则推断,漏报和误报都可能存在,正式外发前请人工过一遍。

Q:「换成稳定代号」有什么用?

A:同一个原值每次都会映射成同一个代号(比如手机号#a3f2)。这样既抹掉了真实信息,又保留了「这些是同一个人的记录」这一关联关系,方便后续做数据分析。

Q:内部工号这种自家格式能识别吗?

A:可以。在「自定义正则」里加一条规则,比如 EMP-\d{6},工具会一并处理。

常见问题

文档会上传到服务器吗?
不会。整个识别与打码过程都在你的浏览器里完成,文档内容一步都没有离开设备。这是它和在线 API 类脱敏服务最本质的区别,处理合同、名单、病历都可以放心。
识别准吗?会漏吗?
手机号、邮箱这类格式固定的识别率很高;身份证会验校验位、银行卡会验 Luhn,误报很少。但姓名、住址靠正则推断,漏报和误报都可能存在,正式外发前请人工过一遍。
「换成稳定代号」有什么用?
同一个原值每次都会映射成同一个代号(比如手机号#a3f2)。这样既抹掉了真实信息,又保留了「这些是同一个人的记录」这一关联关系,方便后续做数据分析。
内部工号这种自家格式能识别吗?
可以。在「自定义正则」里加一条规则,比如 EMP-\d{6},工具会一并处理。