Skip to main content

Tutorial 15: Document Security & Redaction

Master PII detection, automated redaction workflows, and privacy compliance for legal document productions with Claude or ChatGPT.

CubreClaude: verificadoChatGPT / Codex: borradorGrok Bot: borrador

Qué harás

Este tutorial le guía a través de flujos de trabajo de seguridad documental y redacción censurada—detección de PII, redacción automatizada y cumplimiento de privacidad—utilizando su asistente de IA. Seguirá una ruta clara paso a paso.

Flujo de trabajo principal en Claude: ejecute los prompts a continuación dentro de un Project de asunto (Tutorial 04), use un comando de plugin legal cuando exista (Tutorial 06) y conecte conectores de investigación mediante MCP (Tutorial 07). Escale el material de alto riesgo antes de la producción.

Objetivos de aprendizaje

Al final de este tutorial, usted podrá:

  • Dominar la detección e identificación de PII en conjuntos documentales
  • Implementar flujos de trabajo de redacción automatizada para texto y PDFs
  • Gestionar redacciones en múltiples formatos, incluidas imágenes y archivos nativos
  • Aplicar técnicas de desidentificación y anonimización
  • Ejecutar enmascaramiento de datos para entornos de prueba listos para producción
  • Garantizar el cumplimiento de GDPR/CCPA en producciones de discovery
  • Verificar la integridad y precisión de las redacciones
  • Gestionar redacciones en registros de privilegio de manera sistemática
  • Crear documentos de demostración y capacitación conformes
  • Gestionar datos de terceros con las protecciones adecuadas

Parte 1: Detección e identificación de PII

El desafío del riesgo de privacidad

Los litigios modernos implican información personal sensible en diversos tipos de documentos. Las redacciones omitidas generan responsabilidad, infracciones regulatorias y incumplimientos éticos.

Categorías clave de PII:

1. Identity Information
   - Nombres completos, apodos
   - Fechas de nacimiento
   - Números de Seguro Social (SSN)
   - Números de licencia de conducir
   - Números de pasaporte
   - Números de identificación fiscal

2. Contact Information
   - Direcciones de correo electrónico personales
   - Números de teléfono móvil
   - Direcciones particulares
   - Datos de GPS/ubicación

3. Financial Information
   - Números de cuenta bancaria
   - Números de tarjeta de crédito
   - Números de ruta bancaria
   - Límites/saldos de crédito

4. Medical Information
   - Diagnósticos
   - Nombres de medicamentos
   - Nombres de hospitales/prestadores
   - Números de historia clínica

5. Organizational Information
   - IDs de empleados
   - Cargos internos
   - Extensiones telefónicas de la empresa
   - Direcciones de correo electrónico internas

6. Biometric Data
   - Huellas dactilares
   - Datos de reconocimiento facial
   - Muestras de firma

Reconocimiento de patrones para la detección de PII

Paso 1: Identificar automáticamente los tipos de información

Necesito escanear un conjunto de documentos de discovery para detectar información de identificación personal.

Por favor, cree un protocolo integral de detección de PII que:

1. Identifique todos los SSN (formato XXX-XX-XXXX y variantes)
2. Encuentre fechas de nacimiento (patrones MM/DD/YYYY)
3. Localice direcciones particulares (direcciones completas, no comerciales)
4. Detecte direcciones de correo electrónico personales
5. Identifique números de teléfono personales (móvil vs. comercial)
6. Señale información médica (diagnósticos, medicamentos, tratamiento)
7. Detecte números de cuentas financieras
8. Identifique números de licencia de conducir y pasaporte

Para cada tipo de PII encontrado:
- Ubicación exacta en el documento
- Contexto (oración que contiene la PII)
- Clasificación de sensibilidad (Alta/Media/Baja)
- Requisito regulatorio (GDPR/CCPA/HIPAA/otro)

Cree una lista de verificación de detección con patrones regex para cada categoría.

Paso 2: Flujo de trabajo de reconocimiento de entidades

Analice este conjunto de documentos para identificar entidades nombradas:

1. Nombres de personas (nombre y apellido)
   - Distinga de nombres comerciales
   - Identifique personas repetidas
   - Vincule variaciones (Dr. Smith vs. Robert Smith)

2. Organizaciones (empresas, instituciones)
   - Distinga de entidades comerciales personales
   - Identifique sede central vs. sucursales
   - Clasifique como proveedor, cliente, competidor

3. Ubicaciones (direcciones específicas)
   - Distinga dirección particular de dirección comercial
   - Identifique ubicaciones sensibles
   - Mapee la distribución geográfica

4. Relaciones (quién conoce a quién)
   - Relaciones familiares
   - Relaciones comerciales
   - Relaciones profesionales

Cree un diagrama de relaciones entre entidades que muestre las conexiones.
Formatee los resultados como un CSV con: Entity Name | Entity Type | Location(s) | Context | Sensitivity Level

Paso 3: Clasificación de sensibilidad

Clasifique la PII identificada por nivel de sensibilidad para priorizar los esfuerzos de redacción y garantizar el cumplimiento de los requisitos de producción.

Clasifique la PII identificada por nivel de sensibilidad:

HIGH SENSITIVITY (debe redactarse en todas las producciones):
- SSNs y números de identificación gubernamental
- Números de cuentas financieras
- Diagnósticos médicos y detalles de tratamiento
- Direcciones particulares específicas
- Números de teléfono móvil personales

MEDIUM SENSITIVITY (redactar salvo que sea necesario para el caso):
- Direcciones de correo electrónico personales
- Nombre y apellido de personas (si no son parte/testigo)
- Fechas de nacimiento
- Nombres y ubicaciones del empleador

LOW SENSITIVITY (puede no requerir redacción):
- Cargos laborales
- Números de teléfono comerciales
- Afiliaciones profesionales
- Cargos públicos por designación

Cree una matriz de prioridad de redacción que muestre qué PII debe redactarse
en cada tipo de producción (contraparte, tribunal, custodio tercero, etc.).

Ejercicio práctico 1.1: Construir su protocolo de detección de PII

Cree un protocolo de detección y clasificación de PII para:
- 500 documentos de discovery (mezcla de correos electrónicos, adjuntos y formularios)
- Múltiples formatos documentales (PDF, Word, Excel, imágenes)
- Direcciones y números de teléfono internacionales
- Información médica, financiera y laboral

Su protocolo debe incluir:

1. Lista completa de tipos de PII con patrones de detección
2. Esquema de clasificación de sensibilidad (con 3-4 niveles)
3. Reglas específicas por tipo de producción (contraparte vs. tribunal)
4. Procedimientos para gestionar falsos positivos
5. Lista de control de calidad (proceso de verificación)
6. Estimación de tiempo para revisión automatizada vs. manual
7. Análisis costo/beneficio de distintos enfoques de redacción

Estimación: ¿Cuánto tiempo tomaría la revisión manual? ¿Cuánto tiempo ahorra
la detección asistida por IA?

Parte 2: Flujos de trabajo de redacción automatizada

Estrategia de redacción de texto

Paso 1: Preparar documentos para la redacción

Tengo un conjunto de documentos de discovery que necesitan redacción antes de la producción.

Por favor, cree un flujo de trabajo de redacción que incluya:

1. Inventario documental (cantidad, tipos, formatos)
2. Identificación de PII (todas las instancias de SSN, direcciones, números de teléfono)
3. Estrategia de redacción (qué PII se redacta en qué producciones)
4. Enfoque de procesamiento por lotes (cómo gestionar todos los documentos eficientemente)
5. Convención de nombres de salida ([ORIGINAL-FILENAME]_REDACTED_[DATE])
6. Control de versiones (seguimiento de original vs. redactado)
7. Lista de verificación (cómo confirmar las redacciones)
8. Pista de auditoría (quién redactó qué, cuándo y por qué)

Cree plantillas para:
- Memorando de decisión de redacción (documentando decisiones de redacción)
- Lista de verificación (proceso de QA)
- Certificado de producción (certificando que las redacciones fueron completadas)

Paso 2: Redacción de texto con sustitución

Redacte este documento según nuestras reglas de producción:

RULES:
- SSNs: Replace with [SSN REDACTED]
- Addresses: Replace with [ADDRESS REDACTED]
- Phone numbers (personal): Replace with [PHONE REDACTED]
- Medical information: Replace with [MEDICAL INFO REDACTED]
- Financial account numbers: Replace with [ACCOUNT REDACTED]

PRESERVE:
- Employee names and titles (not redacted unless specifically marked)
- Business phone numbers and addresses
- Company email addresses

Process:
1. Identify all PII that matches redaction rules
2. Replace with appropriate placeholder
3. Note each redaction in a separate log:
   - Original content (for verification)
   - Redaction reason
   - Page/location in document
4. Maintain consistency (same PII = same replacement)
5. Format output as clean version for production

Output both:
a) Clean redacted document (for production)
b) Redaction log (for verification and privilege log)

Paso 3: Técnicas de redacción de PDF

Los PDFs requieren un manejo especial de capas de texto, capas de imagen, metadatos y objetos incrustados. Una redacción incorrecta puede dejar información sensible recuperable.

Necesito redactar un documento PDF de discovery de 150 páginas.

Cree un flujo de trabajo de redacción de PDF que incluya:

1. Detección OCR (asegurar que se identifique todo el texto, incluido el de imágenes)
2. Redacción de capa de texto (buscar PII en el texto del PDF)
3. Redacción de capa de imagen (identificar PII en imágenes/escaneos incrustados)
4. Limpieza de metadatos (eliminar autor, fecha de creación, historial de edición)
5. Completar campos de formulario (redactar campos de formulario precargados)
6. Gestión de anotaciones (redactar notas manuscritas si es necesario)
7. Conservación de marcadores y enlaces (mantener la estructura del documento)
8. Verificación de salida (asegurar que el texto redactado no pueda seleccionarse)

Para la redacción de PDF, compare:
- Uso de herramientas de redacción (crean recuadros opacos)
- Uso de enmascaramiento (superpone contenido)
- Uso de eliminación (borra el contenido por completo)

¿Qué enfoque es más adecuado para el legal discovery?
¿Cuáles son los riesgos de cada enfoque?

Ejercicio práctico 2.1: Flujo de trabajo de redacción por lotes

Cree un protocolo de redacción por lotes para 250 documentos de múltiples custodios:

Requisitos:
- Distintas reglas de redacción para distintos custodios
- Rastrear qué documentos han sido redactados
- Mantener control de versiones
- Crear registros de verificación
- Generar certificado de producción
- Gestionar formatos documentales mixtos

Su flujo de trabajo debe incluir:

1. Ingreso y categorización de documentos
2. Reglas de redacción específicas por custodio
3. Enfoque de procesamiento por lotes (reducir trabajo manual)
4. Muestreo de control de calidad (utilice un tamaño de muestra basado en riesgo; escale para documentos de alto riesgo)
5. Escalamiento de problemas (cómo gestionar casos difíciles)
6. Verificación final antes de la producción
7. Registro y documentación de la producción

Cree un cronograma del proyecto y una estimación de recursos.

Parte 3: Redacciones de imágenes y archivos nativos

Gestión de redacción en múltiples formatos

Paso 1: Identificar desafíos específicos por formato

Estamos redactando documentos de discovery en múltiples formatos:
- PDFs (escaneados y nativos)
- Microsoft Word (con control de cambios)
- Hojas de cálculo Excel (con fórmulas y columnas ocultas)
- Presentaciones PowerPoint
- TIFFs y JPGs escaneados
- Correo electrónico con imágenes incrustadas y adjuntos

Cree una guía de redacción específica por formato que aborde:

1. Escaneos PDF
   - Limitaciones de detección de texto/OCR
   - Técnicas de redacción de imágenes
   - Eliminación de metadatos

2. Microsoft Word
   - Texto oculto en cambios controlados
   - Comentarios e historial de revisiones
   - Objetos incrustados y archivos OLE
   - Encabezados/pies de página/números de página

3. Excel
   - Columnas y filas ocultas
   - Comentarios y notas de celdas
   - Contenido de la barra de fórmulas (puede diferir del valor mostrado)
   - Enlaces y conexiones externas

4. PowerPoint
   - Notas del presentador
   - Comentarios de diapositivas
   - Contenido incrustado
   - Diapositivas ocultas

5. Archivos de correo electrónico
   - Metadatos (To, From, CC, BCC, Date, Subject)
   - Cuerpo del mensaje
   - Imágenes incrustadas
   - Adjuntos

Para cada formato, especifique:
- Riesgos más altos de PII
- Áreas de redacción difíciles
- Requisitos de verificación
- Herramientas necesarias

Paso 2: Detección de texto en imágenes

Tengo documentos escaneados (archivos JPG y TIFF) que contienen información sensible.

Cree un flujo de trabajo de redacción de imágenes:

1. OCR Processing
   - Convert image text to searchable format
   - Identify confidence levels (low confidence = manual review)
   - Handle handwritten notes vs. typed text
   - Address image quality issues (faded, rotated, multi-page scans)

2. PII Detection in Images
   - Locate SSNs, addresses, phone numbers
   - Identify medical, financial, or other sensitive data
   - Note location (pixel coordinates or describe location)

3. Redaction Application
   - Create blackout boxes over sensitive information
   - Ensure boxes completely obscure text
   - Verify no text is visible under redaction
   - Apply consistently formatted boxes

4. Output Options
   - Marked-for-redaction version (for reviewer approval)
   - Final redacted version (black boxes applied)
   - Searchable PDF (OCR'd text with redactions applied)

Create a quality control checklist for image redactions.
What percentage of images should be manually verified?

Paso 3: Gestión de objetos incrustados

Algunos de nuestros documentos de discovery contienen objetos incrustados:
- Objetos OLE en documentos Word
- Hojas de Excel incrustadas en PowerPoint
- Imágenes y archivos vinculados
- Fuentes y recursos incrustados

Cree un protocolo para identificar y redactar objetos incrustados:

1. Detección
   - Cómo identificar contenido incrustado
   - Herramientas para extraer objetos incrustados
   - Riesgos de omitir contenido incrustado

2. Evaluación de riesgo
   - ¿Qué objetos incrustados presentan riesgos de PII?
   - ¿Cuáles pueden dejarse de forma segura tal como están?
   - ¿Cuáles deberían eliminarse por completo?

3. Estrategia de redacción
   - ¿Redactar dentro de los objetos incrustados?
   - ¿Eliminar todo el objeto incrustado?
   - ¿Reemplazar con un marcador de posición?
   - ¿Documentar las decisiones de manejo?

4. Verificación
   - Cómo confirmar que el contenido incrustado está redactado
   - Herramientas para comprobar contenido oculto
   - Requisitos de pista de auditoría

Proporcione ejemplos específicos de contenido incrustado de alto riesgo.

Paso 4: Limpieza de metadatos

Antes de producir documentos de discovery, debe eliminar todos los metadatos que puedan revelar información privilegiada o estrategia.

Antes de producir documentos de discovery, necesitamos eliminar todos los metadatos.

Cree un protocolo de limpieza de metadatos que cubra:

DOCUMENT METADATA:
- Author name and initials
- Company name
- Creation date
- Last modified date
- Last modified by
- Template name
- Subject and keywords
- Comments and notes

EMAIL METADATA:
- Original message ID
- Internet headers (containing server routing)
- Original timestamp and timezone
- BCC recipients (if any)
- Sent on behalf of (delegation)
- Folder location

DOCUMENT PROPERTIES:
- Edit history
- Tracked changes (accept/reject to remove)
- Comments and revision marks
- Hidden text or comments
- Variable values
- Links and external references

For each metadata type:
1. Specify if it must be removed or can be preserved
2. Describe removal method for each format
3. Verify removal technique (how to confirm?)
4. Risk if metadata is not removed (privacy/strategic concerns)

Create a format-by-format metadata removal checklist.

Ejercicio práctico 3.1: Proyecto de redacción en múltiples formatos

Tiene un conjunto documental con formatos mixtos que requiere redacción:

DOCUMENTS:
- 50 archivos PDF (mezcla de escaneados y nativos)
- 30 documentos Word (con control de cambios)
- 20 hojas de cálculo Excel
- 10 presentaciones PowerPoint
- 5 archivos de exportación de correo electrónico (con imágenes/adjuntos incrustados)
- 40 imágenes TIFF escaneadas (baja calidad, notas manuscritas)

REDACTION RULES:
- Redact all SSNs, home addresses, personal phone numbers
- Redact medical diagnoses and treatment information
- Remove metadata from all documents
- Strip tracked changes and comments from Word
- Redact form fields and hidden columns from Excel
- Remove speaker notes and comments from PowerPoint

Create a complete project plan including:

1. Document assessment (by format type)
2. Format-specific redaction strategy
3. Quality control approach (especially for images)
4. Team resource requirements
5. Timeline and milestones
6. Verification procedures
7. Risk mitigation (what could go wrong?)
8. Production certificate requirements

Estimate total time and cost.

Parte 4: Patrones de desidentificación

Técnicas de anonimización

Paso 1: Tokens de reemplazo consistentes

Necesito desidentificar un conjunto documental para demostrar flujos de trabajo
al equipo técnico de la contraparte (no pueden ver nombres reales).

Cree una estrategia de desidentificación que:

1. Asigne tokens de reemplazo a cada persona:
   - Person A = [INDIVIDUAL-001]
   - Person B = [INDIVIDUAL-002]
   - Witness A = [WITNESS-001]
   - Expert A = [EXPERT-001]

2. Mantenga la consistencia en todo el conjunto documental
   - Cada instancia de "John Smith" se convierte en [INDIVIDUAL-001]
   - Su correo "john.smith@company.com" también se convierte en [INDIVIDUAL-001]
   - Su cargo "Sales Manager" se reemplaza por [SALES ROLE-001]

3. Preserve la utilidad del documento
   - Las relaciones entre personas permanecen claras
   - La cronología permanece intacta
   - Las referencias documentales siguen funcionando

4. Cree un mapa de desidentificación (mantenido confidencial):
   - [INDIVIDUAL-001] = John Smith [SSN: 123-45-6789]
   - [SALES ROLE-001] = Sales Manager
   - [COMPANY-A] = TechCorp Inc.

5. Proceso de verificación
   - No quedan nombres originales en la versión desidentificada
   - No queda información personal identificable
   - El mapa se almacena por separado de forma segura

Cree una plantilla de desidentificación que muestre tanto la versión original
como la versión desidentificada de un documento de muestra.

Paso 2: Flujos de trabajo de seudonimización

Anonimización (irreversible): no se puede identificar a la persona original ni siquiera con la clave. Seudonimización (reversible): se puede reidentificar con la tabla de búsqueda. La seudonimización es útil para ensayos clínicos, análisis de marketing y situaciones en las que la reidentificación pueda ser necesaria posteriormente.

Cree un protocolo de seudonimización que difiera de la anonimización:

ANONYMIZATION (irreversible):
- Cannot identify original person even with the key
- Example: Replace SSN with random hash value

PSEUDONYMIZATION (reversible, keyed):
- Can re-identify with the lookup table
- Useful for clinical trials, marketing analysis
- Example: Replace SSN with token "PSN-001987-AC"

Develop a workflow that:

1. Assigns pseudonym to each individual:
   - Original: Susan Johnson, DOB 1978-03-15, SSN 234-56-7890
   - Pseudonym: PSN-001
   - Maintains first letter of last name? Or fully random?

2. Applies pseudonym consistently across documents
   - All mentions of Susan Johnson → PSN-001
   - All her contact info → PSN-001
   - Her role/title → kept but separated from pseudonym

3. Creates secure pseudonym table
   - Stored separately from production documents
   - Encrypted storage
   - Access controlled and logged
   - Retention/deletion policy

4. De-reversal procedure
   - How to re-identify if needed for litigation
   - Audit trail requirements
   - Authorization controls

Create a pseudonym assignment algorithm that:
- Generates unique identifiers
- Prevents accidental re-identification
- Allows batch processing
- Creates audit trail

Ejercicio práctico 4.1: Proyecto de desidentificación

Cree un protocolo de desidentificación para este escenario:

Está preparando un conjunto de muestra de 100 documentos para:
- Revisión por el equipo técnico de la contraparte
- Revisor experto que no necesita conocer identidades
- Capacitación/demostración para el cliente
- Autoridad regulatoria (anonimizado para orientación pública)

Requisitos:
- Todas las personas identificadas solo por rol/función
- Sin SSNs, direcciones ni números de teléfono
- Sin nombres de empresas (use códigos descriptivos)
- Cronología y referencias documentales preservadas
- No queda información identificable
- Mapa de desidentificación mantenido seguro y separado

Su protocolo debe incluir:

1. Mapeo de desidentificación
   - Todas las personas y sus reemplazos
   - Todas las empresas y sus reemplazos
   - Todos los roles sensibles y sus reemplazos

2. Lista de verificación
   - No aparecen nombres originales
   - No aparece información de contacto
   - No aparecen identificaciones gubernamentales
   - Las relaciones siguen claras
   - La cronología sigue siendo coherente

3. Controles de acceso
   - ¿Quién puede acceder a las versiones originales vs. desidentificadas?
   - ¿Cómo se comparten los documentos?
   - ¿Cómo se protege el mapa de desidentificación?

4. Pista de auditoría
   - ¿Quién creó la versión desidentificada?
   - ¿Cuándo se creó?
   - ¿Qué cambios se hicieron?
   - ¿Quién ha accedido a ella?

Parte 5: Enmascaramiento de datos y preparación de entornos de prueba

Enmascaramiento de datos listo para producción

Paso 1: Generación de datos de muestra

Necesito crear documentos de prueba/demostración realistas basados en documentos
reales de discovery, sin usar información real de clientes/partes.

Cree un protocolo de enmascaramiento de datos y generación de muestras:

1. ANALYZE ORIGINAL DOCUMENTS
   - Document types and formats
   - Data fields and content structure
   - Relationship patterns (who communicates with whom)
   - Timeline and date ranges
   - Topic themes and vocabulary

2. GENERATE REALISTIC SAMPLES
   - Create fictional individuals (realistic names, but not real people)
   - Assign fictional roles and departments
   - Create fictional companies and subsidiaries
   - Generate realistic dates and timelines
   - Use realistic communication patterns
   - Match vocabulary and terminology of originals

3. MAINTAIN RELATIONSHIPS
   - Preserve who-reports-to-whom structure
   - Preserve communication patterns (who talks to whom)
   - Preserve timeline logic (event sequence)
   - Preserve document references (reports, memos, etc.)

4. CREATE REALISTIC ATTACHMENTS
   - Generate sample spreadsheets (realistic structure, fake data)
   - Generate sample reports (same format, new content)
   - Generate sample emails (same tone, new substance)

5. VERIFICATION
   - Does sample data look realistic?
   - Can documents be used for training/demo?
   - Any remnants of real information?
   - Are relationships and timelines logical?

Generate 10 sample documents that would work for:
- Staff training
- Opposing counsel demo
- Expert witness review
- Court system demo
- Technical platform testing

Paso 2: Preparación del entorno de prueba

Estamos configurando un entorno de prueba para nuestra plataforma de soporte de litigios.

Cree un protocolo para poblar el entorno de prueba con datos seguros:

1. ESTRATEGIA DE FUENTE DE DATOS
   - Opción A: usar datos sintéticos/generados (completamente ficticios)
   - Opción B: usar datos reales con enmascaramiento aplicado
   - Opción C: usar datos reales con subconjunto aprobado
   - Ventajas/desventajas de cada enfoque

2. REGLAS DE ENMASCARAMIENTO DE DATOS
   - ¿Qué campos se enmascaran?
   - ¿Cómo se aplica el enmascaramiento? (hashing, reemplazo, cifrado)
   - ¿El enmascaramiento es reversible?
   - ¿Los datos de prueba pueden usarse para pruebas de rendimiento?

3. VOLUMEN DE DATOS
   - ¿Cuántos datos de prueba necesita?
   - Tamaño de muestra para pruebas realistas
   - Escalado para pruebas de rendimiento
   - Equilibrio entre realismo y eficiencia

4. RELACIONES DE DATOS
   - Mantener integridad referencial
   - Preservar lógica de negocio
   - Probar escenarios realistas
   - Soportar pruebas de casos límite

5. CONTROLES DE ACCESO
   - ¿Quién puede acceder al entorno de prueba?
   - ¿Qué datos pueden ver?
   - Registro de auditoría para acceso a datos de prueba
   - Política de retención/eliminación para datos de prueba

Cree una estrategia de datos de prueba para una plataforma de litigios
que necesita más de 100 documentos de muestra realistas.

Paso 3: Creación de documentos de demostración

Cree un protocolo para generar documentos de demostración/capacitación:

REQUIREMENTS:
- Documents must look and feel real
- Must demonstrate actual workflows and challenges
- Cannot contain any actual confidential information
- Must be suitable for external sharing (client, opposing counsel)
- Must include realistic examples of:
  * Privilege issues
  * Responsive vs. non-responsive
  * PII redaction needs
  * Metadata problems
  * Format conversion issues

DEMO DOCUMENT SCENARIOS:

1. DISCOVERY PRODUCTION DEMO
   - 25 documents showing typical issues
   - Include examples of proper and improper redactions
   - Show metadata challenges (tracked changes, comments)
   - Show format challenges (PDFs, scans, emails)

2. PRIVILEGE LOG DEMO
   - 15 documents with privilege assertions
   - Range of privilege types (attorney-client, work product)
   - Examples of proper vs. improper assertions
   - Show withholding rationale

3. REDACTION VERIFICATION DEMO
   - Examples of properly applied redactions
   - Examples of inadequate redactions
   - Show detection techniques
   - Demonstrate verification checklist

4. DEPOSITION TRANSCRIPT DEMO
   - Sample testimony with PII
   - Examples of privilege issues
   - Show redaction strategy
   - Demonstrate transcript analysis

Create a master demo document set suitable for:
- Client training on redaction procedures
- Staff onboarding on discovery workflows
- Opposing counsel platform demo
- Court system demonstration
- Regulatory authority briefing

Estimate: How much time to create realistic demo set?
What are the key challenges?

Ejercicio práctico 5.1: Estrategia de datos de prueba

Diseñe una estrategia completa de datos de prueba para una plataforma legal tech:

PLATFORM FEATURES (that need test data):
- Document upload and indexing
- Automatic PII detection
- Redaction workflow
- OCR for scanned documents
- Email threading
- Timeline generation
- Deposition transcript analysis
- Search functionality (full-text)

TEST DATA REQUIREMENTS:

1. Volume and Mix
   - At least 500 documents for realistic testing
   - Multiple formats (PDF, Word, Excel, Email, Images)
   - Mix of quality (clear, poor scans, handwritten)
   - Various document types (emails, reports, contracts, etc.)

2. Realistic Content
   - Industry-specific vocabulary
   - Realistic workflows and communication patterns
   - Realistic timelines
   - Realistic relationships between individuals

3. Challenge Documents
   - Documents with all PII types (SSN, addresses, DOB, etc.)
   - Scanned documents with poor OCR challenges
   - PDFs with embedded objects
   - Emails with extensive attachments
   - Documents with privilege issues

4. Verification
   - No actual confidential information
   - Safe to share with vendors/contractors
   - Safe to use in production demo

Your test data strategy should include:

1. Data generation approach
2. Content guidelines (realistic but fictional)
3. QA/verification checklist
4. Access controls
5. Retention/destruction policy
6. Cost estimate
7. Timeline to completion

Present as if proposing to your managing partner.

Parte 6: Consideraciones de cumplimiento de privacidad

Requisitos de GDPR/CCPA

Paso 1: Implicaciones del GDPR en discovery

Nuestra producción de discovery incluye datos personales de residentes de la UE.

Cree un protocolo de discovery conforme con GDPR:

1. MINIMIZACIÓN DE DATOS
   - Produzca solo información relevante para el caso
   - Redacte datos personales no necesarios para el caso
   - Evalúe cada documento: ¿la PII es necesaria?
   - Equilibre la necesidad jurídica legítima vs. los derechos de privacidad

2. IDENTIFICACIÓN DE DATOS PERSONALES
   - Todos los datos relativos a una persona identificada/identificable
   - Incluye no solo identificadores obvios sino también:
     * Apodos y seudónimos
     * Direcciones de correo electrónico comerciales
     * IDs de empleados/clientes
     * Identificadores de dispositivos (direcciones IP)
     * Combinación de factores (p. ej., cargo + departamento = identificable)

3. CATEGORÍAS ESPECIALES (Protección reforzada)
   - Origen racial o étnico
   - Opiniones políticas
   - Creencias religiosas o filosóficas
   - Afiliación sindical
   - Datos genéticos
   - Datos biométricos
   - Datos de salud
   - Datos sobre vida sexual u orientación sexual

   Para categorías especiales: precaución adicional, posible redacción completa

4. BASE JURÍDICA PARA EL tratamiento de datos
   - ¿Qué base jurídica justifica la producción de PII?
   - ¿Es suficiente una orden judicial?
   - ¿Debe limitar la divulgación a los abogados de las partes?
   - ¿Qué período de retención de datos aplica?

5. EVALUACIÓN DE IMPACTO EN LA PROTECCIÓN DE DATOS (DPIA)
   - Evalúe los riesgos de privacidad de la producción
   - Documente enfoques alternativos
   - Aplique técnicas de minimización
   - Documente la toma de decisiones

6. RESTRICCIONES DE TRANSFERENCIA (si se envía fuera de la UE)
   - Cláusulas Contractuales Tipo (SCCs)
   - Decisiones de adecuación
   - Acuerdos de protección de datos con los destinatarios
   - Medidas complementarias para abordar riesgos

Cree una lista de verificación de cumplimiento de GDPR para producciones de discovery.

Para categorías especiales del GDPR (datos de salud, origen racial/étnico, opiniones políticas, etc.), extreme la cautela y considere la redacción completa salvo que sea absolutamente necesario para el caso.

Paso 2: Requisitos de CCPA

La California Consumer Privacy Act afecta el discovery si los documentos
se relacionan con residentes de California.

Cree un protocolo de discovery conforme con CCPA:

1. INFORMACIÓN PERSONAL SEGÚN CCPA (Más amplia que GDPR)
   - Nombre e información de contacto
   - Información comercial
   - Actividad de internet/navegación
   - Datos de geolocalización
   - Información sensorial (voz, video)
   - Información profesional
   - Información educativa
   - Datos inferidos (perfiles, predicciones)

2. DERECHOS DEL CONSUMIDOR EN DISCOVERY
   - Derecho a saber qué información existe
   - Derecho de supresión (¿puede prevalecer una litigation hold?)
   - Derecho a optar por no participar en la venta (pero el e-discovery puede requerir revisión)
   - Derecho a la no discriminación
   - Derecho a limitar el uso y la divulgación

3. OBLIGACIONES DE LA EMPRESA
   - Aviso de privacidad (si se está tratando información personal)
   - Contratos con proveedores de servicios (acuerdos de confidencialidad)
   - Calendario de retención/eliminación de datos
   - Respuesta a solicitudes de eliminación (¿conflicto con litigation hold?)

4. CUESTIONES ESPECÍFICAS DE DISCOVERY
   - ¿Puede producir información personal sin consentimiento del consumidor?
     * En respuesta a una solicitud de las autoridades: Sí, con aviso
     * En respuesta a una citación civil: Circunstancias limitadas
     * En litigio: En general sí, pero considere el impacto en la privacidad
   - Conflicto entre litigation hold y derechos de eliminación
   - Momento de destrucción después de que termine el litigio

5. PISTA DE AUDITORÍA CCPA
   - Documente qué información personal tiene
   - Documente quién ha accedido a ella
   - Documente períodos de retención
   - Documente procedimientos de eliminación

Cree un marco de cumplimiento de CCPA para producciones de discovery
que involucren residentes de California.

Requisitos de producción de discovery

Paso 1: Redacción de registro de privilegio

Cree un protocolo integral de redacción de registros de privilegio:

¿QUÉ SE REDACTA EN EL REGISTRO DE PRIVILEGIO?

1. CONTENIDO SUSTANTIVO
   - Redacte descripciones de comunicaciones privilegiadas
   - No describa el asesoramiento legal brindado
   - No resuma análisis de work product

   BIEN: "Email from outside counsel regarding litigation strategy"
   MAL: "Email from outside counsel recommending settlement threshold of $2M"

2. IDENTIFICACIÓN DE PARTICIPANTES
   - Partes/abogado interno: por lo general no se redacta
   - Abogado externo: por lo general no se redacta (es información pública)
   - Terceros: a veces se redacta (p. ej., custodio documental)
   - Consultores vs. abogados: puede requerir redacción

3. FECHA E IDENTIFICACIÓN DEL DOCUMENTO
   - Números de producción: no se redactan (usted está produciendo el registro)
   - Fechas del documento: por lo general no se redactan
   - Nombres de documentos: redacte si son descriptivos (véase arriba)
   - Números de página: no se redactan

4. ALEGACIÓN DE PRIVILEGIO
   - Tipo de privilegio: indíquelo claramente (attorney-client, work product)
   - Base de la alegación: descríbala sin revelar el contenido
   - Titular del privilegio: identifíquelo
   - Parte que lo invoca: identifíquela claramente

5. DOCUMENTOS RETENIDOS
   - Marque claramente como "WITHHELD ON GROUNDS OF PRIVILEGE"
   - No los incluya en la producción
   - Pero SÍ inclúyalos en el registro de privilegio

TEMPLATE ENTRIES:

Good Entry:
"Email dated 1/15/2024, from outside counsel to company management,
regarding legal strategy in pending litigation.
Privileged attorney-client communication.
WITHHELD ON GROUNDS OF ATTORNEY-CLIENT PRIVILEGE"

Poor Entry (reveals too much):
"Email dated 1/15/2024, from Smith & Associates LLP to John Doe
recommending settlement offer of $5 million to avoid costly trial.
Work product - attorney strategy.
WITHHELD ON GROUNDS OF ATTORNEY WORK PRODUCT"

Cree una plantilla de registro de privilegio y una guía de redacción.

Paso 2: Gestión de datos de terceros

Nuestra producción de discovery incluye información sobre terceros
(proveedores, competidores, clientes) que no solicitaron privilegio.

Cree un protocolo para la protección de datos de terceros:

1. PREGUNTAS DE EVALUACIÓN
   - ¿La información se refiere a un tercero identificable?
   - ¿Ese tercero querría que esta información se protegiera?
   - ¿La información es confidencial comercial o personal?
   - ¿La divulgación perjudicaría la posición competitiva del tercero?
   - ¿La divulgación vulneraría la privacidad del tercero?

2. OPCIONES DE PROTECCIÓN

   Opción A: PRODUCIR SIN PROTECCIÓN
   - Receptiva y no privilegiada
   - Sin obligación de confidencialidad frente a terceros
   - Sin alternativa para evitar la producción
   - Ejemplo: presentación regulatoria pública

   Opción B: PRODUCIR CON DESIGNACIÓN DE CONFIDENCIALIDAD
   - Marcar como "CONFIDENTIAL - THIRD PARTY INFO"
   - Restringir el acceso solo a los abogados de las partes
   - Incluir en una protective order
   - Puede requerir notificación de consentimiento al tercero

   Opción C: REDACTAR INFORMACIÓN ESPECÍFICA DEL TERCERO
   - Eliminar detalles personales o confidenciales comerciales
   - Redactar secretos comerciales
   - Redactar información personal sensible
   - Preservar la información receptiva esencial

   Opción D: SOLICITAR PROTECTIVE ORDER
   - Solicitar una orden judicial que limite el acceso
   - Justificar la necesidad de protección
   - Proponer restricciones de acceso
   - Requiere aprobación judicial

3. GESTIÓN DOCUMENTAL
   - Rastrear qué documentos contienen información de terceros
   - Señalar para revisión de confidencialidad antes de la producción
   - Incluir leyenda de confidencialidad en los documentos
   - Añadir al registro de privilegio si se retienen por completo
   - Documentar la justificación de la decisión

4. NOTIFICACIÓN A TERCEROS (a veces requerida)
   - Algunas jurisdicciones requieren notificar a los terceros afectados
   - Oportunidad para solicitar protective order
   - Cronograma para respuesta del tercero
   - Impacto en el calendario de producción

Cree una matriz de gestión de datos de terceros para:
- Información de proveedores
- Información de clientes
- Información de competidores
- Información de empleados
- Información de pacientes/salud
- Información de socios financieros

Especifique qué nivel de protección aplica a cada categoría.

Ejercicio práctico 6.1: Protocolo de producción conforme

Cree un protocolo integral de cumplimiento para una producción de discovery
que involucra múltiples jurisdicciones y marcos de privacidad:

ESCENARIO:
- Producción de 5.000 documentos en litigio multiestatal
- Los documentos involucran: 8 empleados, 15 clientes, 3 proveedores
- Ubicaciones: California, Nueva York, Texas y UE (2 empleados)
- Contiene: datos financieros, información médica, registros de personal

REQUISITOS:
- Cumplimiento de CCPA (residentes de CA)
- Cumplimiento de GDPR (residentes de la UE)
- Leyes estatales de privacidad (estándares de privacidad de NY, TX)
- Estándares sectoriales (datos sanitarios)
- Políticas de la empresa (acuerdos de confidencialidad)
- Órdenes judiciales (restricciones judiciales)

Su protocolo debe incluir:

1. ANÁLISIS JURISDICCIÓN POR JURISDICCIÓN
   - ¿Qué leyes de privacidad aplican?
   - ¿Cuál es la base jurídica para la producción?
   - ¿Qué protecciones especiales aplican?
   - ¿Quién debe aprobar la producción?

2. CLASIFICACIÓN DE DATOS
   - Mapear los 5.000 documentos
   - Identificar PII por tipo y sensibilidad
   - Clasificar por jurisdicción/persona
   - Señalar categorías especiales (salud, finanzas)

3. DECISIONES DE PRODUCCIÓN PARA CADA DOCUMENTO
   - ¿Producir tal cual?
   - ¿Producir con redacciones?
   - ¿Retener por privilegio?
   - ¿Solicitar protective order?
   - ¿Notificar a un tercero antes de producir?

4. MEDIDAS DE PROTECCIÓN
   - Designaciones de confidencialidad
   - Restricciones de acceso
   - Métodos de transmisión segura
   - Seguimiento de destinatarios

5. DOCUMENTACIÓN
   - Memorando de producción
   - Decisiones de redacción y justificación
   - Registro de privilegio (si aplica)
   - Certificado de cumplimiento
   - Pista de auditoría

6. CRONOGRAMA Y RECURSOS
   - Tiempo estimado de revisión
   - Miembros del equipo necesarios
   - Presupuesto
   - Ruta crítica

7. CONTROL DE CALIDAD
   - Verificación por muestreo aleatorio
   - Comprobación de integridad de redacción
   - Verificación de alegaciones de privilegio
   - Lista de verificación de cumplimiento

Presente esto como una propuesta a un socio de litigios.
¿Cómo gestionaría los conflictos entre los derechos de eliminación de CCPA
y las obligaciones de litigation hold?

Comparación: Seguridad asistida por IA vs. competidores

TaskManual ApproachAI-AssistedPrivate AIRelativity
Detección de PII en 500 documentosRevisión manual más lenta; la consistencia varía según el revisorPrimera pasada más rápida guiada por protocolos (requiere verificación)Modelos especializados; el rendimiento varía según la herramientaFlujos de trabajo rápidos dentro de la plataforma cuando ya está implementada
Toma de decisiones de redacciónCriterio del abogado; consume mucho tiempoEl asistente analiza sensibilidad, contexto y cumplimientoSolo etiquetas automatizadas; razonamiento limitadoBasado en reglas; requiere configuración
Protocolo de desidentificaciónMapeo manual, propenso a erroresAsignación consistente de tokens, verificadaHerramientas básicas de anonimizaciónConfiguración de flujo de trabajo personalizado
Limpieza de metadatosProceso manual formato por formatoProtocolo consciente del formato con verificaciónSoporte limitado de formatosNativo para archivos de Relativity
Revisión de cumplimiento GDPR/CCPARequiere asesoría especializadaEl asistente genera evaluación de cumplimientoCobertura jurisdiccional limitadaFlujo de cumplimiento, costo prohibitivo
Generación de datos de pruebaCopiar datos reales + enmascaramiento manualDatos sintéticos realistas, verificados como segurosSolo genera copias enmascaradasMódulo de síntesis de datos (costoso)
Calidad del registro de privilegioLa calidad manual varía según revisor/procesoMejoras de consistencia impulsadas por plantillasSolo entrada manualAutomatización de flujo disponible
Gestión en múltiples formatosRequiere múltiples herramientas/experienciaProtocolo unificado para todos los formatosLimitado a formatos específicosFunciona dentro del ecosistema Relativity
Tiempo para producción de 5.000 documentosDepende de la complejidad y del personal del equipoNormalmente se reduce con automatización del flujo; valide mediante pilotoDepende del ajuste del modelo y del proceso de revisiónPuede ser rápido con flujos maduros dentro de la plataforma
Modelo de costoPrincipalmente tiempo de abogado/revisorBasado en uso + tiempo de revisión del abogadoSuscripción/licencia + tiempo de revisiónSuscripción a plataforma + tiempo de revisión

Diferenciadores clave:

Ventajas del asistente general:

  • Razonamiento flexible sobre contexto y matices de cumplimiento
  • El soporte de archivos y los requisitos de procesamiento varían según formato, plan y herramienta
  • Genera protocolos y orientación, no solo automatización
  • Flexibilidad de desidentificación y anonimización
  • Modelos de uso flexibles (verifique plan/precio vigentes)
  • Accesible de inmediato sin configuración de proveedor

Ventajas de Relativity:

  • Diseñado específicamente para flujos de trabajo de legal discovery
  • Integrado con herramientas estándar del sector
  • Más rápido si ya utiliza la plataforma Relativity
  • Analítica avanzada y filtrado

Ventajas de Private AI:

  • Diseñado específicamente para detección de PII
  • Entrenamiento especializado sobre tipos de datos sensibles
  • Puede tener mejor precisión en tipos específicos de PII

Resumen y buenas prácticas

Flujo de trabajo completo de seguridad

  1. EVALUAR sus documentos para detectar PII y contenido sensible
  2. CLASIFICAR la información por sensibilidad y requisitos regulatorios
  3. DISEÑAR la estrategia de redacción y desidentificación
  4. IMPLEMENTAR usando protocolos guiados por el asistente
  5. VERIFICAR integridad y precisión
  6. DOCUMENTAR todas las decisiones y procedimientos
  7. PRODUCIR con confianza y pista de auditoría

Lecciones clave aprendidas

  • La consistencia es crítica: use tokens de reemplazo, plantillas y listas de verificación
  • El formato importa: diseñe enfoques específicos por formato (PDFs ≠ Word ≠ Email)
  • Los metadatos son peligrosos: no olvide contenido oculto, control de cambios y comentarios
  • El cumplimiento es multijurisdiccional: GDPR, CCPA y leyes estatales pueden aplicar
  • La verificación es esencial: muestree, haga comprobaciones puntuales y audite las redacciones
  • La documentación le protege: registro de privilegio, memorandos de decisión, certificados

Fuentes

Lecturas adicionales


Haga esto ahora

  • Cree un protocolo de detección de PII para un tipo documental
  • Ejecute un flujo de trabajo de redacción de texto con reglas de sustitución
  • Aplique limpieza de metadatos a un documento de muestra
  • Construya un mapa de desidentificación o seudonimización
  • Cree un conjunto documental de prueba/demostración con enmascaramiento
  • Complete una lista de verificación de cumplimiento de GDPR o CCPA para una producción
  • Documente sus decisiones de redacción y pasos de verificación

Tarea antes de la producción

  1. Audite sus procesos - Documente los procedimientos actuales de manejo de PII (auditoría manual de 10 documentos aleatorios)

  2. Mapee sus obligaciones de cumplimiento - Cree un cuadro de todas las leyes de privacidad aplicables por jurisdicción

  3. Construya su matriz de redacción - Cree reglas sobre qué se redacta en distintos tipos de producción

  4. Desarrolle su lista de verificación - Diseñe su enfoque de control de calidad para una muestra de 100 documentos

  5. Configure su playbook - Cree protocolos para sus tipos documentales más comunes (correos, contratos, registros financieros)


Tiempo estimado de finalización: 45 minutos para el tutorial completo Prerrequisitos: Tutorials 1-7 (Core concepts) Siguientes pasos: Tutorial 16 (Contract Intelligence)


Relacionado


On this page