文档脱敏是什么
文档外发前要抹掉个人信息,人工一个个找既慢又容易漏。做法是先用规则批量识别,再按需要选择打码强度。
这个工具能做什么
- 识别十三种敏感信息:姓名、手机号、身份证、银行卡、邮箱、住址、IP、车牌、统一社会信用代码、护照、QQ、微信、座机
- 四种打码方式:保留首尾、全部打码、换类型标签、换稳定代号
- 身份证校验位与银行卡 Luhn 双重校验,压低误报
- 支持白名单、姓名识别增强与自定义正则
怎么使用(输入说明)
- 粘贴文本或导入 txt / csv / json 文件
- 勾选要识别的类型,按需加自定义规则
- 选打码方式,看命中统计
- 复制或下载脱敏后的文本
使用时的几个注意点
- 命中明细默认不显示原文,避免二次泄露
- 姓名识别增强会提高召回但也增加误报
- 「换成稳定代号」模式适合还要做关联分析的场景
实例
一份客户登记表,识别出姓名 1 处、手机号 1 处、身份证 1 处、住址 1 处,保留首尾模式输出为 张*、138****5678、110101********123X。
常见问题 FAQ
Q:文档会上传到服务器吗?
A:不会。整个识别与打码过程都在你的浏览器里完成,文档内容一步都没有离开设备。这是它和在线 API 类脱敏服务最本质的区别,处理合同、名单、病历都可以放心。
Q:识别准吗?会漏吗?
A:手机号、邮箱这类格式固定的识别率很高;身份证会验校验位、银行卡会验 Luhn,误报很少。但姓名、住址靠正则推断,漏报和误报都可能存在,正式外发前请人工过一遍。
Q:「换成稳定代号」有什么用?
A:同一个原值每次都会映射成同一个代号(比如手机号#a3f2)。这样既抹掉了真实信息,又保留了「这些是同一个人的记录」这一关联关系,方便后续做数据分析。
Q:内部工号这种自家格式能识别吗?
A:可以。在「自定义正则」里加一条规则,比如 EMP-\d{6},工具会一并处理。