Skip to main content

教程 15: Document Security & Redaction

Master PII detection, automated redaction workflows, and privacy compliance for legal document productions with Claude or ChatGPT.

覆盖Claude: 已验证ChatGPT / Codex: 草稿Grok Bot: 草稿

你将做什么

本教程将引导你使用 AI 助手完成文档安全与遮盖工作流——PII 检测、自动化遮盖以及隐私合规。你将沿着一条清晰的分步路径进行学习。

Claude 中的主要工作流: 在案件 Project(教程 04)中运行下列提示;如有对应功能,则使用 Legal 插件命令(教程 06);并通过 MCP 连接研究连接器(教程 07)。高风险材料在正式产出前应升级处理。

学习目标

完成本教程后,你将能够:

  • 掌握跨文档集的 PII 检测与识别
  • 实施针对文本和 PDF 的自动化遮盖工作流
  • 处理包含图像和原生文件的跨格式遮盖
  • 应用去标识化与匿名化技术
  • 执行适用于生产级测试环境的数据脱敏
  • 确保取证生产中的 GDPR/CCPA 合规
  • 核验遮盖的完整性与准确性
  • 系统化管理特权日志遮盖
  • 创建合规的演示与培训文档
  • 对第三方数据采取适当保护措施

第 1 部分:PII 检测与识别

隐私风险挑战

现代诉讼涉及分布于多种文档类型中的敏感个人信息。遗漏遮盖会带来责任、监管违规和伦理失范风险。

PII 关键类别:

1. 身份信息
   - 全名、昵称
   - 出生日期
   - 社会安全号码(SSN)
   - 驾驶证号码
   - 护照号码
   - 税号

2. 联系信息
   - 个人电子邮箱地址
   - 手机号码
   - 家庭住址
   - GPS/位置数据

3. 财务信息
   - 银行账户号码
   - 信用卡号码
   - 路由号码
   - 信用额度/余额

4. 医疗信息
   - 诊断信息
   - 药物名称
   - 医院/服务提供者名称
   - 病历号码

5. 组织信息
   - 员工 ID
   - 内部职位名称
   - 公司电话分机
   - 内部电子邮箱地址

6. 生物识别数据
   - 指纹
   - 面部识别数据
   - 签名样本

用于 PII 检测的模式识别

第 1 步:自动识别信息类型

我需要扫描一组证据开示文档,以识别个人身份信息。

请创建一套全面的 PII 检测协议,要求:

1. 识别所有 SSN(XXX-XX-XXXX 格式及其变体)
2. 查找出生日期(MM/DD/YYYY 模式)
3. 定位家庭住址(完整街道地址,不包括商业地址)
4. 检测个人电子邮箱地址
5. 识别个人电话号码(手机与商务电话区分)
6. 标记医疗信息(诊断、药物、治疗)
7. 检测金融账户号码
8. 识别驾驶证和护照号码

对于发现的每种 PII:
- 文档中的精确位置
- 上下文(包含该 PII 的句子)
- 敏感性分类(高/中/低)
- 监管要求(GDPR/CCPA/HIPAA/其他)

为每个类别创建包含 regex 模式的检测清单。

第 2 步:实体识别工作流

分析这组文档中的命名实体:

1. 个人姓名(名和姓)
   - 与企业名称区分
   - 识别重复出现的个人
   - 关联不同写法(Dr. Smith vs. Robert Smith)

2. 组织(公司、机构)
   - 与个人商业实体区分
   - 识别总部与分支机构
   - 分类为供应商、客户、竞争对手

3. 地点(具体地址)
   - 区分家庭地址与商业地址
   - 识别敏感地点
   - 绘制地理分布

4. 关系(谁与谁相识)
   - 家庭关系
   - 商业关系
   - 职业关系

创建一个显示关联关系的实体关系图。
将结果格式化为 CSV,字段为:Entity Name | Entity Type | Location(s) | Context | Sensitivity Level

第 3 步:敏感性分类

按敏感性级别对已识别的 PII 进行分类,以便确定遮盖工作的优先顺序,并确保符合生产要求。

按敏感性级别对已识别的 PII 进行分类:

高敏感(所有生产中都必须遮盖):
- SSN 和政府身份证号码
- 金融账户号码
- 医疗诊断和治疗细节
- 具体家庭住址
- 个人手机号码

中敏感(除非案件需要,否则应遮盖):
- 个人电子邮箱地址
- 个人姓名(若非当事人/证人)
- 出生日期
- 雇主名称和地点

低敏感(可能不需要遮盖):
- 职位名称
- 商务电话号码
- 职业隶属关系
- 公共任命职位

创建一个遮盖优先级矩阵,说明各类 PII
在每种生产类型(对方、法院、第三方保管人等)中是否必须遮盖。

实操练习 1.1:建立你的 PII 检测协议

为以下场景创建一套 PII 检测与分类协议:
- 500 份证据开示文档(混合邮件、附件、表单)
- 多种文档格式(PDF、Word、Excel、图像)
- 国际地址和电话号码
- 医疗、财务和就业信息

你的协议应包括:

1. 包含模式的完整 PII 类型检测清单
2. 敏感性分类方案(3-4 个级别)
3. 按生产类型区分的规则(对方 vs. 法院)
4. 误报处理程序
5. 质量控制清单(核验流程)
6. 自动化审查与人工审查的时间估算
7. 不同遮盖方法的成本/收益分析

估算:人工审查需要多长时间?
AI 辅助检测可以节省多少时间?

第 2 部分:自动化遮盖工作流

文本遮盖策略

第 1 步:为遮盖准备文档

我有一组证据开示文档,需要在生产前进行遮盖。

请创建一个遮盖工作流,包括:

1. 文档清点(数量、类型、格式)
2. PII 识别(所有 SSN、地址、电话号码实例)
3. 遮盖策略(哪些 PII 在哪些生产中需要遮盖)
4. 批处理方法(如何高效处理所有文档)
5. 输出命名规范([ORIGINAL-FILENAME]_REDACTED_[DATE])
6. 版本控制(跟踪原件与遮盖版本)
7. 核验清单(如何确认遮盖)
8. 审计轨迹(谁在何时为何遮盖了什么)

创建以下模板:
- 遮盖决策备忘录(记录遮盖选择)
- 核验清单(QA 流程)
- 生产证明(证明已完成遮盖)

第 2 步:使用替换符的文本遮盖

根据我们的生产规则遮盖此文档:

规则:
- SSNs: Replace with [SSN REDACTED]
- Addresses: Replace with [ADDRESS REDACTED]
- Phone numbers (personal): Replace with [PHONE REDACTED]
- Medical information: Replace with [MEDICAL INFO REDACTED]
- Financial account numbers: Replace with [ACCOUNT REDACTED]

保留:
- 员工姓名和职务(除非有明确标记,否则不遮盖)
- 商务电话号码和地址
- 公司电子邮箱地址

处理流程:
1. 识别所有符合遮盖规则的 PII
2. 替换为相应占位符
3. 在单独日志中记录每次遮盖:
   - 原始内容(用于核验)
   - 遮盖原因
   - 文档中的页码/位置
4. 保持一致性(相同 PII = 相同替换)
5. 将输出格式整理为适于生产的整洁版本

同时输出:
a) 干净的遮盖后文档(用于生产)
b) 遮盖日志(用于核验和特权日志)

第 3 步:PDF 遮盖技术

PDF 需要特别处理文本层、图像层、元数据和嵌入对象。不当遮盖可能导致敏感信息仍可被恢复。

我需要遮盖一份 150 页的 PDF 证据开示文档。

创建一个 PDF 遮盖工作流,包括:

1. OCR 检测(确保包括图像中的文字在内的所有文本都被识别)
2. 文本层遮盖(在 PDF 文本中搜索 PII)
3. 图像层遮盖(识别嵌入图像/扫描件中的 PII)
4. 元数据清理(移除作者、创建日期、编辑历史)
5. 表单字段处理(遮盖预填表单字段)
6. 注释处理(必要时遮盖手写注释)
7. 书签和链接保留(保持文档结构)
8. 输出核验(确保被遮盖文本不可选中)

对于 PDF 遮盖,请比较:
- 使用遮盖工具(创建不透明方框)
- 使用遮罩(覆盖内容)
- 使用移除(彻底删除内容)

哪种方法更适合法律证据开示?
每种方法的风险是什么?

实操练习 2.1:批量遮盖工作流

为来自多个保管人的 250 份文档创建一套批量遮盖协议:

要求:
- 对不同保管人适用不同遮盖规则
- 跟踪哪些文档已完成遮盖
- 保持版本控制
- 创建核验日志
- 生成生产证明
- 处理混合文档格式

你的工作流应包括:

1. 文档接收与分类
2. 保管人特定的遮盖规则
3. 批处理方法(减少人工工作)
4. 质量控制抽样(使用基于风险的样本量;高风险文档应升级处理)
5. 问题升级(如何处理复杂情况)
6. 生产前最终核验
7. 生产日志与文档记录

创建项目时间表和资源估算。

第 3 部分:图像与原生文件遮盖

跨格式遮盖处理

第 1 步:识别特定格式的挑战

我们正在对多种格式的证据开示文档进行遮盖:
- PDFs(扫描件和原生文件)
- Microsoft Word(带修订痕迹)
- Excel 电子表格(含公式和隐藏列)
- PowerPoint 演示文稿
- 扫描的 TIFF 和 JPG
- 带嵌入图像和附件的电子邮件

创建一份按格式划分的遮盖指南,涵盖:

1. PDF 扫描件
   - 文本检测/OCR 限制
   - 图像遮盖技术
   - 元数据剥离

2. Microsoft Word
   - 修订痕迹中的隐藏文本
   - 评论和修订历史
   - 嵌入对象和 OLE 文件
   - 页眉/页脚/页码

3. Excel
   - 隐藏列和行
   - 单元格评论和注释
   - 公式栏内容(可能与显示值不同)
   - 外部链接和连接

4. PowerPoint
   - 演讲者备注
   - 幻灯片评论
   - 嵌入内容
   - 隐藏幻灯片

5. 电子邮件文件
   - 元数据(To、From、CC、BCC、Date、Subject)
   - 邮件正文
   - 嵌入图像
   - 附件

对于每种格式,请说明:
- 最高的 PII 风险
- 最难处理的遮盖区域
- 核验要求
- 所需工具

第 2 步:图像文本检测

我有一些包含敏感信息的扫描文档(JPG 和 TIFF 文件)。

创建一个图像遮盖工作流:

1. OCR 处理
   - 将图像文本转换为可搜索格式
   - 标识置信度级别(低置信度 = 人工审查)
   - 处理手写注释与印刷文本
   - 应对图像质量问题(褪色、旋转、多页扫描)

2. 图像中的 PII 检测
   - 定位 SSN、地址、电话号码
   - 识别医疗、财务或其他敏感数据
   - 记录位置(像素坐标或位置描述)

3. 应用遮盖
   - 在敏感信息上方创建黑框
   - 确保方框完全遮住文本
   - 核验遮盖下方无任何可见文本
   - 统一应用格式一致的方框

4. 输出选项
   - 标记待遮盖版本(供审查人批准)
   - 最终遮盖版本(已应用黑框)
   - 可搜索 PDF(带 OCR 文本并已应用遮盖)

创建一份图像遮盖的质量控制清单。
多少比例的图像应进行人工核验?

第 3 步:嵌入对象处理

我们的部分证据开示文档包含嵌入对象:
- Word 文档中的 OLE 对象
- PowerPoint 中嵌入的 Excel 表
- 链接图像和文件
- 嵌入字体和资源

创建一套识别和遮盖嵌入对象的协议:

1. 检测
   - 如何识别嵌入内容
   - 提取嵌入对象的工具
   - 漏掉嵌入内容的风险

2. 风险评估
   - 哪些嵌入对象具有 PII 风险?
   - 哪些可以安全保持原状?
   - 哪些应被完全移除?

3. 遮盖策略
   - 在嵌入对象内部遮盖?
   - 移除整个嵌入对象?
   - 替换为占位符?
   - 记录处理决定?

4. 核验
   - 如何确认嵌入内容已被遮盖
   - 检查隐藏内容的工具
   - 审计轨迹要求

请提供高风险嵌入内容的具体示例。

第 4 步:元数据清理

在生产证据开示文档之前,你必须移除所有可能泄露特权信息或诉讼策略的元数据。

在生产证据开示文档之前,我们需要移除所有元数据。

创建一套元数据清理协议,涵盖:

文档元数据:
- 作者姓名和姓名首字母
- 公司名称
- 创建日期
- 最后修改日期
- 最后修改者
- 模板名称
- 主题和关键词
- 评论和注释

电子邮件元数据:
- 原始 message ID
- Internet headers(包含服务器路由)
- 原始时间戳和时区
- BCC 收件人(如有)
- Sent on behalf of(代理发送)
- 文件夹位置

文档属性:
- 编辑历史
- 修订痕迹(接受/拒绝以移除)
- 评论和修订标记
- 隐藏文本或评论
- 变量值
- 链接和外部引用

对于每种元数据类型:
1. 说明是否必须移除或可以保留
2. 描述每种格式下的移除方法
3. 核验移除技术(如何确认?)
4. 若不移除元数据的风险(隐私/策略顾虑)

创建一份按格式划分的元数据移除清单。

实操练习 3.1:多格式遮盖项目

你有一组需要遮盖的混合格式文档:

文档:
- 50 个 PDF 文件(扫描件和原生文件混合)
- 30 个 Word 文档(带修订痕迹)
- 20 个 Excel 电子表格
- 10 个 PowerPoint 演示文稿
- 5 个电子邮件导出文件(带嵌入图像/附件)
- 40 张扫描 TIFF 图像(质量差,含手写注释)

遮盖规则:
- 遮盖所有 SSN、家庭住址、个人电话号码
- 遮盖医疗诊断和治疗信息
- 移除所有文档中的元数据
- 从 Word 中剥离修订痕迹和评论
- 遮盖 Excel 中的表单字段和隐藏列
- 移除 PowerPoint 中的演讲者备注和评论

创建完整的项目计划,包括:

1. 文档评估(按格式类型)
2. 按格式划分的遮盖策略
3. 质量控制方法(特别是图像)
4. 团队资源需求
5. 时间表和里程碑
6. 核验程序
7. 风险缓解(可能出什么问题?)
8. 生产证明要求

估算总时间和成本。

第 4 部分:去标识化模式

匿名化技术

第 1 步:一致的替换令牌

我需要对一组文档进行去标识化,以便向对方律师的技术团队演示工作流
(他们不能看到真实姓名)。

创建一套去标识化策略,要求:

1. 为每个个人分配替换令牌:
   - Person A = [INDIVIDUAL-001]
   - Person B = [INDIVIDUAL-002]
   - Witness A = [WITNESS-001]
   - Expert A = [EXPERT-001]

2. 在整个文档集中保持一致性
   - 每一处 “John Smith” 都变为 [INDIVIDUAL-001]
   - 他的电子邮箱 “john.smith@company.com” 也变为 [INDIVIDUAL-001]
   - 他的角色 “Sales Manager” 替换为 [SALES ROLE-001]

3. 保留文档实用性
   - 人物关系仍然清晰
   - 时间线保持完整
   - 文档引用仍可使用

4. 创建去标识化映射表(保密保存):
   - [INDIVIDUAL-001] = John Smith [SSN: 123-45-6789]
   - [SALES ROLE-001] = Sales Manager
   - [COMPANY-A] = TechCorp Inc.

5. 核验流程
   - 去标识化版本中不保留任何原始姓名
   - 不保留任何可识别的个人信息
   - 映射表单独安全存储

创建一个去标识化模板,展示样本文档的原始版本
和去标识化版本。

第 2 步:假名化工作流

匿名化(不可逆):即使有密钥也无法识别原始个人。假名化(可逆):可以通过对照表重新识别。假名化适用于临床试验、营销分析,以及日后可能需要重新识别的场景。

创建一套区别于匿名化的假名化协议:

匿名化(不可逆):
- 即使有密钥也无法识别原始个人
- 示例:将 SSN 替换为随机哈希值

假名化(可逆、有密钥):
- 可通过对照表重新识别
- 适用于临床试验、营销分析
- 示例:将 SSN 替换为令牌 “PSN-001987-AC”

设计一个工作流,要求:

1. 为每个个人分配假名:
   - 原始:Susan Johnson, DOB 1978-03-15, SSN 234-56-7890
   - 假名:PSN-001
   - 是否保留姓氏首字母?还是完全随机?

2. 在文档间一致应用假名
   - 所有对 Susan Johnson 的提及 → PSN-001
   - 她的所有联系信息 → PSN-001
   - 她的角色/职务 → 保留,但与假名分离

3. 创建安全的假名对照表
   - 与生产文档分开存储
   - 加密存储
   - 访问控制并记录日志
   - 保留/删除政策

4. 反向还原程序
   - 如诉讼需要,如何重新识别
   - 审计轨迹要求
   - 授权控制

创建一个假名分配算法,要求:
- 生成唯一标识符
- 防止意外重新识别
- 支持批处理
- 创建审计轨迹

实操练习 4.1:去标识化项目

为以下场景创建一套去标识化协议:

你正在准备一组 100 份文档样本,用于:
- 对方律师技术团队审查
- 无需知晓身份的专家审查人
- 客户培训/演示用途
- 监管机构(用于公开指引的匿名化版本)

要求:
- 所有个人仅以角色/职能标识
- 不含 SSN、地址、电话号码
- 不含公司名称(使用描述性代码)
- 保留时间线和文档引用
- 不保留任何可识别信息
- 去标识化映射表单独安全保存

你的协议应包括:

1. 去标识化映射
   - 所有个人及其替换项
   - 所有公司及其替换项
   - 所有敏感角色及其替换项

2. 核验清单
   - 不出现原始姓名
   - 不出现联系信息
   - 不出现政府证件号
   - 关系仍然清晰
   - 时间线仍然连贯

3. 访问控制
   - 谁可以访问原始版本与去标识化版本?
   - 文档如何共享?
   - 去标识化映射表如何保护?

4. 审计轨迹
   - 谁创建了去标识化版本?
   - 何时创建?
   - 做了哪些变更?
   - 谁访问过?

第 5 部分:数据脱敏与测试环境准备

面向生产的数据脱敏

第 1 步:样本数据生成

我需要基于真实证据开示文档创建逼真的测试/演示文档,
但不能使用任何真实客户/当事人信息。

创建一套数据脱敏与样本生成协议:

1. 分析原始文档
   - 文档类型和格式
   - 数据字段和内容结构
   - 关系模式(谁与谁通信)
   - 时间线和日期范围
   - 主题和词汇

2. 生成逼真样本
   - 创建虚构个人(名称真实感强,但不是真实人物)
   - 分配虚构角色和部门
   - 创建虚构公司和子公司
   - 生成逼真的日期和时间线
   - 使用逼真的沟通模式
   - 匹配原始文档的词汇和术语

3. 保持关系
   - 保留汇报关系结构
   - 保留沟通模式(谁与谁交流)
   - 保留时间线逻辑(事件顺序)
   - 保留文档引用(报告、备忘录等)

4. 创建逼真的附件
   - 生成样本电子表格(结构逼真,数据虚构)
   - 生成样本报告(格式相同,内容全新)
   - 生成样本邮件(语气相似,实质内容全新)

5. 核验
   - 样本数据看起来是否逼真?
   - 文档能否用于培训/演示?
   - 是否残留任何真实信息?
   - 关系和时间线是否合乎逻辑?

生成 10 份适用于以下场景的样本文档:
- 员工培训
- 对方律师演示
- 专家证人审查
- 法院系统演示
- 技术平台测试

第 2 步:测试环境准备

我们正在为诉讼支持平台搭建测试环境。

创建一套使用安全数据填充测试环境的协议:

1. 数据来源策略
   - 选项 A:使用合成/生成数据(完全虚构)
   - 选项 B:使用已脱敏的真实数据
   - 选项 C:使用经过批准的真实数据子集
   - 各种方法的优缺点

2. 数据脱敏规则
   - 哪些字段要脱敏?
   - 如何应用脱敏?(哈希、替换、加密)
   - 脱敏是否可逆?
   - 测试数据是否可用于性能测试?

3. 数据规模
   - 你需要多少测试数据?
   - 用于逼真测试的样本量
   - 用于性能测试的扩展策略
   - 在真实性与效率之间取得平衡

4. 数据关系
   - 保持引用完整性
   - 保留业务逻辑
   - 测试逼真的场景
   - 支持边界情况测试

5. 访问控制
   - 谁可以访问测试环境?
   - 他们可以看到哪些数据?
   - 测试数据访问的审计日志
   - 测试数据的保留/删除政策

为一个需要 100+ 份逼真样本文档的诉讼平台
创建测试数据策略。

第 3 步:演示文档创建

创建一套生成演示/培训文档的协议:

要求:
- 文档必须看起来和使用起来都真实
- 必须能展示实际工作流和挑战
- 不能包含任何真实的机密信息
- 必须适合对外共享(客户、对方律师)
- 必须包含以下内容的逼真实例:
  * 特权问题
  * 响应性与非响应性
  * PII 遮盖需求
  * 元数据问题
  * 格式转换问题

演示文档场景:

1. 证据开示生产演示
   - 25 份文档展示典型问题
   - 包括适当和不当遮盖的示例
   - 展示元数据挑战(修订痕迹、评论)
   - 展示格式挑战(PDF、扫描件、邮件)

2. 特权日志演示
   - 15 份文档包含特权主张
   - 多种特权类型(律师-客户特权、工作成果)
   - 适当与不当主张的示例
   - 展示拒绝提供的理由

3. 遮盖核验演示
   - 已正确应用遮盖的示例
   - 遮盖不足的示例
   - 展示检测技术
   - 演示核验清单

4. 证言笔录演示
   - 含 PII 的样本证词
   - 特权问题示例
   - 展示遮盖策略
   - 演示笔录分析

创建一套主演示文档集,适用于:
- 客户遮盖程序培训
- 员工证据开示工作流入职培训
- 对方律师平台演示
- 法院系统演示
- 向监管机构简报

估算:创建一套逼真的演示文档集需要多少时间?
关键挑战是什么?

实操练习 5.1:测试数据策略

为一个法律科技平台设计完整的测试数据策略:

平台功能(需要测试数据):
- 文档上传和索引
- 自动 PII 检测
- 遮盖工作流
- 扫描文档 OCR
- 邮件线程整理
- 时间线生成
- 证言笔录分析
- 搜索功能(全文)

测试数据要求:

1. 数量和组合
   - 至少 500 份文档用于逼真测试
   - 多种格式(PDF、Word、Excel、Email、Images)
   - 质量混合(清晰、较差扫描、手写)
   - 多种文档类型(邮件、报告、合同等)

2. 逼真内容
   - 行业特定词汇
   - 逼真的工作流和沟通模式
   - 逼真的时间线
   - 个人之间逼真的关系

3. 挑战性文档
   - 包含所有 PII 类型的文档(SSN、地址、DOB 等)
   - OCR 挑战较大的低质量扫描文档
   - 含嵌入对象的 PDF
   - 带大量附件的电子邮件
   - 含特权问题的文档

4. 核验
   - 不含任何真实机密信息
   - 可安全地与供应商/承包商共享
   - 可安全用于生产演示

你的测试数据策略应包括:

1. 数据生成方法
2. 内容指南(逼真但虚构)
3. QA/核验清单
4. 访问控制
5. 保留/销毁政策
6. 成本估算
7. 完成时间表

请以向管理合伙人提案的方式呈现。

第 6 部分:隐私合规考量

GDPR/CCPA 要求

第 1 步:证据开示中的 GDPR 影响

我们的证据开示生产包含欧盟居民的个人数据。

创建一套符合 GDPR 的证据开示协议:

1. 数据最小化
   - 仅生产与案件相关的信息
   - 遮盖案件不必要的个人数据
   - 评估每份文档:PII 是否必要?
   - 平衡合法法律需求与隐私权

2. 个人数据识别
   - 所有与已识别/可识别个人相关的数据
   - 不仅包括明显标识符,还包括:
     * 昵称和假名
     * 商业电子邮箱地址
     * 员工/客户 ID
     * 设备标识符(IP 地址)
     * 因素组合(例如:职位 + 部门 = 可识别)

3. 特殊类别(加强保护)
   - 种族或民族来源
   - 政治观点
   - 宗教或哲学信仰
   - 工会成员身份
   - 基因数据
   - 生物识别数据
   - 健康数据
   - 性生活或性取向数据

   对于特殊类别:应特别谨慎,必要时考虑完全遮盖

4. 数据处理的法律依据
   - 生产 PII 的法律依据是什么?
   - 法院命令是否足够?
   - 是否必须将披露限制为双方律师?
   - 数据保留期限是什么?

5. 数据保护影响评估(DPIA)
   - 评估生产的隐私风险
   - 记录替代方法
   - 应用最小化技术
   - 记录决策过程

6. 传输限制(如发送至欧盟外)
   - Standard Contractual Clauses (SCCs)
   - 充分性决定
   - 与接收方签订数据保护协议
   - 用于应对风险的补充措施

创建一份用于证据开示生产的 GDPR 合规清单。

对于 GDPR 特殊类别(健康数据、种族/民族来源、政治观点等),应格外谨慎;除非案件绝对必要,否则应考虑完全遮盖。

第 2 步:CCPA 要求

如果文档涉及加州居民,California Consumer Privacy Act 会影响证据开示。

创建一套符合 CCPA 的证据开示协议:

1. CCPA 下的“个人信息”(比 GDPR 更宽泛)
   - 姓名和联系信息
   - 商业信息
   - 互联网/浏览活动
   - 地理位置数据
   - 感官信息(语音、视频)
   - 职业信息
   - 教育信息
   - 推断数据(画像、预测)

2. 证据开示中的消费者权利
   - 知晓存在哪些信息的权利
   - 删除权(诉讼保全是否可以覆盖?)
   - 选择退出销售的权利(但电子取证可能仍需审查)
   - 不受歧视权
   - 限制使用和披露的权利

3. 企业义务
   - 隐私通知(如正在处理个人信息)
   - 服务提供商合同(保密协议)
   - 数据保留/删除时间表
   - 对删除请求的响应(与 litigation hold 冲突?)

4. 证据开示中的特定问题
   - 在未经消费者同意的情况下,能否生产个人信息?
     * 回应执法请求:可以,但需通知
     * 回应民事传票:限于特定情形
     * 在诉讼中:通常可以,但应考虑隐私影响
   - 诉讼保全与删除权之间的冲突
   - 诉讼结束后的销毁时间安排

5. CCPA 审计轨迹
   - 记录你持有哪些个人信息
   - 记录谁访问过这些信息
   - 记录保留期限
   - 记录删除程序

创建一套适用于涉及加州居民的证据开示生产的 CCPA 合规框架。

证据开示生产要求

第 1 步:特权日志遮盖

创建一套全面的特权日志遮盖协议:

特权日志中应遮盖什么?

1. 实质性内容
   - 遮盖对特权通信的描述
   - 不要描述所提供的法律意见
   - 不要概述工作成果分析

   好:"Email from outside counsel regarding litigation strategy"
   坏:"Email from outside counsel recommending settlement threshold of $2M"

2. 参与人识别
   - 当事人/内部法务:通常不遮盖
   - 外部律师:通常不遮盖(属公开信息)
   - 第三方:有时需要遮盖(例如文档保管人)
   - 顾问与律师:可能需要遮盖

3. 日期和文档识别
   - 生产编号:不遮盖(你正在生产该日志)
   - 文档日期:通常不遮盖
   - 文档名称:如具描述性则应遮盖(见上)
   - 页码:不遮盖

4. 特权主张
   - 特权类型:明确说明(律师-客户特权、工作成果)
   - 主张依据:在不泄露内容的情况下描述
   - 特权持有人:应予识别
   - 主张方:应清晰识别

5. 被扣留文档
   - 明确标记为 "WITHHELD ON GROUNDS OF PRIVILEGE"
   - 不要包含在生产中
   - 但必须包含在特权日志中

模板条目:

良好条目:
"Email dated 1/15/2024, from outside counsel to company management,
regarding legal strategy in pending litigation.
Privileged attorney-client communication.
WITHHELD ON GROUNDS OF ATTORNEY-CLIENT PRIVILEGE"

较差条目(泄露过多):
"Email dated 1/15/2024, from Smith & Associates LLP to John Doe
recommending settlement offer of $5 million to avoid costly trial.
Work product - attorney strategy.
WITHHELD ON GROUNDS OF ATTORNEY WORK PRODUCT"

创建一份特权日志模板和遮盖指南。

第 2 步:第三方数据处理

我们的证据开示生产包含关于第三方
(供应商、竞争对手、客户)的信息,而他们并未主张特权。

创建一套第三方数据保护协议:

1. 评估问题
   - 该信息是否涉及可识别的第三方?
   - 第三方是否希望该信息受到保护?
   - 该信息是商业机密还是个人信息?
   - 披露是否会损害第三方的竞争地位?
   - 披露是否会侵犯第三方隐私?

2. 保护选项

   选项 A:不加保护直接生产
   - 具响应性且不享有特权
   - 不存在第三方保密义务
   - 无法通过其他方式避免生产
   - 示例:公开监管备案文件

   选项 B:附保密指定后生产
   - 标记为 "CONFIDENTIAL - THIRD PARTY INFO"
   - 仅限双方律师访问
   - 纳入保护令
   - 可能需要通知第三方并征得同意

   选项 C:遮盖第三方特定信息
   - 移除商业机密或个人细节
   - 遮盖商业秘密
   - 遮盖敏感个人信息
   - 保留核心响应性信息

   选项 D:申请保护令
   - 申请法院命令限制访问
   - 说明需要保护的理由
   - 提出访问限制建议
   - 需要法院批准

3. 文档处理
   - 跟踪哪些文档包含第三方信息
   - 在生产前标记为需保密审查
   - 在文档上添加保密标识
   - 如完全扣留,则加入特权日志
   - 记录决策理由

4. 第三方通知(有时需要)
   - 某些法域要求通知受影响的第三方
   - 给予申请保护令的机会
   - 第三方回应的时间表
   - 对生产进度的影响

为以下类别创建一份第三方数据处理矩阵:
- 供应商信息
- 客户信息
- 竞争对手信息
- 员工信息
- 病人/健康信息
- 金融合作伙伴信息

说明每个类别适用的保护级别。

实操练习 6.1:合规生产协议

为一项涉及多个法域和隐私框架的证据开示生产
创建一套全面的合规协议:

场景:
- 在多州诉讼中生产 5,000 份文档
- 文档涉及:8 名员工、15 名客户、3 家供应商
- 地点:California、New York、Texas 和 EU(2 名员工)
- 包含:财务数据、医疗信息、人事记录

要求:
- CCPA 合规(加州居民)
- GDPR 合规(欧盟居民)
- 州隐私法(纽约、得州隐私标准)
- 行业标准(医疗数据)
- 公司政策(保密协议)
- 法院命令(司法约束)

你的协议必须包括:

1. 按法域分析
   - 适用哪些隐私法?
   - 生产的法律依据是什么?
   - 适用哪些特别保护?
   - 谁必须批准该生产?

2. 数据分类
   - 映射全部 5,000 份文档
   - 按类型和敏感性识别 PII
   - 按法域/个人进行分类
   - 标记特殊类别(健康、财务)

3. 每份文档的生产决定
   - 原样生产?
   - 经遮盖后生产?
   - 作为特权材料扣留?
   - 申请保护令?
   - 生产前通知第三方?

4. 保护措施
   - 保密指定
   - 访问限制
   - 安全传输方法
   - 接收方跟踪

5. 文档记录
   - 生产备忘录
   - 遮盖决定及理由
   - 特权日志(如适用)
   - 合规证明
   - 审计轨迹

6. 时间表和资源
   - 预计审查时间
   - 所需团队成员
   - 预算
   - 关键路径

7. 质量控制
   - 随机抽样核验
   - 遮盖完整性检查
   - 特权主张核验
   - 合规检查清单

请将其作为提交给诉讼合伙人的提案进行呈现。
你会如何处理 CCPA 删除权
与 litigation hold 义务之间的冲突?

对比:AI 辅助安全与竞争产品

TaskManual ApproachAI-AssistedPrivate AIRelativity
500 份文档中的 PII 检测较慢的人工审查,一致性因审查人而异更快的协议驱动初筛(需要核验)专用模型;表现因工具而异若已部署,则平台内工作流较快
遮盖决策制定依赖律师判断,耗时助手分析敏感性、上下文和合规性仅自动标签,推理能力有限基于规则,需要配置
去标识化协议手工映射,易出错令牌分配一致,并可核验基础匿名化工具需要自定义工作流设置
元数据清理按格式逐一手工处理具格式感知的协议并附带核验格式支持有限对 Relativity 文件属原生支持
GDPR/CCPA 合规审查需要专业律师助手生成合规评估法域覆盖有限合规工作流,成本较高
测试数据生成复制真实数据 + 手工脱敏逼真的合成数据,并经核验确认安全仅生成已脱敏副本数据合成模块(昂贵)
特权日志质量人工质量因审查人/流程而异模板驱动提升一致性仅支持手工录入可用工作流自动化
跨格式处理需要多种工具/专业能力统一协议处理所有格式仅限特定格式在 Relativity 生态内运作
5,000 份文档生产所需时间取决于复杂性和团队配置通常可通过工作流自动化缩短;应通过试点验证取决于模型匹配度和审查流程若平台工作流成熟,速度可很快
成本模型主要是律师/审查人时间按使用量计费 + 律师审查时间订阅/许可费 + 审查时间平台订阅费 + 审查人时间

关键差异点:

通用助手的优势:

  • 能灵活推理上下文和合规细节
  • 文件支持与处理要求因格式、套餐和工具而异
  • 不仅提供自动化,还生成协议和指导
  • 去标识化和匿名化灵活性更高
  • 使用模式灵活(请核实当前套餐/定价)
  • 无需供应商部署即可立即使用

Relativity 的优势:

  • 专为法律证据开示工作流打造
  • 与行业标准工具集成
  • 如果已在使用 Relativity 平台,则速度更快
  • 具备高级分析和筛选能力

Private AI 的优势:

  • 专为 PII 检测打造
  • 针对敏感数据类型经过专门训练
  • 在特定 PII 类型上可能具有更高准确率

总结与最佳实践

完整安全工作流

  1. 评估 文档中的 PII 和敏感内容
  2. 分类 信息的敏感性和监管要求
  3. 设计 遮盖和去标识化策略
  4. 实施 助手引导下的协议
  5. 核验 完整性与准确性
  6. 记录 所有决定和程序
  7. 生产 时保持信心并保留审计轨迹

关键经验

  • 一致性至关重要:使用替换令牌、模板和清单
  • 格式很重要:按格式设计方法(PDF ≠ Word ≠ Email)
  • 元数据很危险:不要遗漏隐藏内容、修订痕迹和评论
  • 合规具有多法域特征:GDPR、CCPA、州法都可能适用
  • 核验不可或缺:抽样、点查并审计遮盖结果
  • 文档记录保护你:特权日志、决策备忘录、证明文件

来源

延伸阅读


立即实践

  • 为一种文档类型创建一套 PII 检测协议
  • 使用替换规则运行一次文本遮盖工作流
  • 对一个样本文档应用元数据清理
  • 建立一个去标识化或假名化映射表
  • 创建一套经过脱敏的测试/演示文档集
  • 为一次生产完成一份 GDPR 或 CCPA 合规清单
  • 记录你的遮盖决定和核验步骤

生产前作业

  1. 审计你的流程 - 记录当前的 PII 处理程序(对 10 份随机文档进行人工审计)

  2. 梳理你的合规义务 - 按法域创建所有适用隐私法的图表

  3. 建立你的遮盖矩阵 - 为不同生产类型制定遮盖规则

  4. 制定你的核验清单 - 为 100 份文档样本设计质量控制方法

  5. 设置你的操作手册 - 为最常见的文档类型创建协议(邮件、合同、财务记录)


预计完成时间: 完整教程约 45 分钟 前置要求: 教程 1-7(核心概念) 下一步: 教程 16(合同智能)


相关内容


导航