PII 智能发现与分类系统

发现自由文本与结构化数据中的敏感实体 输出带置信度的智能分类

32
大类敏感数据类型
84
细分格式变体
95%
结构化数据 Macro F1
104
覆盖语种
GDPR中国 PIPLCCPA/CPRA印度 DPDP日本 APPI新加坡 PDPA
巴西 LGPDSOC 2ISO 27701HIPAAPCI DSSGLBA

精准判定可靠追溯

多信号交叉印证

上下文信号(列名、字段路径、邻近文本)与多语种语义分析模型逐级融合;规则与模型双源一致的判定优先采信。

  • 多语种语义分析模型,百万级真实样本训练,覆盖 104 种语言
  • 列名、字段路径与邻近文本全部参与决策
  • 每条结果可展开证据:候选类型、判定依据与拒绝原因
  • 26 国身份证校验器、16+ 国税号格式、6 大卡组织
  • 模拟/测试数据识别,演习数据不污染统计
  • 非敏感过滤器前置拦截,明显无关内容不进主流程

校验位确定性佐证

对带校验位的数据类型,数学验证器直接判定真伪:Luhn(银行卡)、IBAN mod-97、Aadhaar Verhoeff、VIN/IMEI。

置信度即真实概率

逐类型置信度校准,让 0.87 意味着“87% 的可能是对的”。高置信直接输出,低置信或多个接近候选自动标记复核,绝不硬猜。您的每一次复核,都在沉淀高价值训练语料:加密回流、持续重训,复核越多,判定越精准。

  • 中文按语言单独校准,中英文不共用阈值
  • 幂等输出:同样输入永远同样结果,可审计可回放

真实流量持续进化

复核结果加密回流为训练语料,防回归地持续校正。 未识别残留聚类,运营确认后运行时晋升新类型,无需发版。

  • 训练语料本地加密无泄露,授权才进入训练闭环
  • 每类 F1、漂移与校准事件在控制台可观测
  • 跨实例知识迁移:语料包导出 / 导入

灵活部署快速接入

容器化部署数分钟接入

浏览器AI Agent数据仓库文档系统邮件与协同DataBrain类型判定校准置信度分层路由

标准 REST API 即插即用

curl -X POST http://127.0.0.1:18000/v1/text/scan \
  -H 'Content-Type: application/json' \
  -d '{
    "text": "客户 john.doe@google.com,电话 +1-415-555-0142。",
    "min_confidence": 0.5
  }'
import requests

text = "客户 john.doe@google.com,电话 +1-415-555-0142。"
resp = requests.post(
    "http://127.0.0.1:18000/v1/text/scan",
    json={"text": text, "min_confidence": 0.5},
    timeout=30,
)
for m in resp.json()["results"]:
    print(m["pii_type"], m["value"], m["confidence"])
const resp = await fetch("http://127.0.0.1:18000/v1/text/scan", {
  method: "POST",
  headers: { "Content-Type": "application/json" },
  body: JSON.stringify({
    text: "客户 john.doe@google.com,电话 +1-415-555-0142。",
    min_confidence: 0.5,
  }),
})
for (const m of (await resp.json()).results)
  console.log(m.pii_type, m.value, m.confidence)
curl -X POST http://127.0.0.1:18000/v1/values/scan \
  -H 'Content-Type: application/json' \
  -d '{
    "values": [
      {"value": "john.doe@google.com", "label_hint": "email"},
      {"value": "110101199003077334", "label_hint": "id_card"}
    ]
  }'
import requests

values = [
    {"value": "john.doe@google.com", "label_hint": "email"},
    {"value": "110101199003077334", "label_hint": "id_card"},
]
resp = requests.post("http://127.0.0.1:18000/v1/values/scan",
                     json={"values": values}, timeout=30)
for r in resp.json()["results"]:
    print(r["pii_type"], r["confidence"], r["role"])
const values = [
  { value: "john.doe@google.com", label_hint: "email" },
  { value: "110101199003077334", label_hint: "id_card" },
]
const resp = await fetch("http://127.0.0.1:18000/v1/values/scan", {
  method: "POST",
  headers: { "Content-Type": "application/json" },
  body: JSON.stringify({ values }),
})
for (const r of (await resp.json()).results)
  console.log(r.pii_type, r.confidence, r.role)

消费级 GPU 实时响应

无需专业算力集群,消费级显卡即可获得毫秒级实时检测(RTX 5070,200 字符典型文档 9ms 检测延时)。 CPU 与 GPU 识别分类精度完全一致,差别只在延时。

DataBrain 控制台系统资源视图
控制台实测:系统资源视图(消费级 GPU · RTX 5070)

数据主权与隐私保护

完全离线

无遥测、无外呼、无外部模型调用;推理全部本地完成,断网环境可运行。

默认脱敏

检测日志默认掩码展示,保留类型与置信度;扫描内容不落盘。

签名交付

签名安装包 + 机器码绑定离线许可证,防回滚、可吊销。

最小权限

非 root 容器运行;训练语料本地加密无泄露,授权才进入训练闭环。

全球合规版图

为合规工作流提供数据底座:32 大类、84 种细分格式,横跨中国、美国、欧盟、亚太、拉美与大洋洲等合规区域。

中国

  • 居民身份证
  • 机动车车牌(GA 36-2014)
  • 回乡证
  • 证券账户(CSDC)
  • 手机号(工信部号段)

印度 / 亚太

  • Aadhaar(Verhoeff)
  • PAN
  • UPI / IFSC
  • 日本 My Number
  • 新加坡 / 澳洲身份证件

全球身份数据

  • 26 国身份证校验器
  • 16+ 国税号 / VAT
  • 护照 / 驾照
  • 精确地理位置(CCPA)
  • 加密货币地址 / 云密钥

金融与通讯

  • 银行卡(Luhn · 6 卡组织)
  • IBAN / SWIFT
  • 信用卡安全码
  • 邮箱 / 电话 / IP / MAC
  • IMEI / VIN

在您的真实环境运行一次,免费试用,开放集成

预约演示