Nivel 2 · En profundidad — la minimización de datos, los artículos y la proyección
§5 — El gate de minimización de datos, explicado
Sección titulada «§5 — El gate de minimización de datos, explicado»Este es el núcleo del Nivel 2, así que merece su propia sección. La tentación, en un dataset educativo, es tratar la edad de un alumno como un dato inocuo — un número entre 15 y 22. El motor mide otra cosa: cuántos alumnos comparten exactamente su combinación de edad, dirección y tamaño de familia. A eso se le llama k-anonimato (Sweeney, 2002): un dataset es k-anónimo respecto a un conjunto de atributos si cada combinación de esos atributos aparece al menos k veces.
Sobre los 1044 alumnos (matemáticas + portugués combinadas), agrupar por edad exacta + dirección (urbana/rural) + tamaño de familia da un mínimo de grupo de 1: 216 de los 1044 alumnos son la única persona con esa combinación exacta. Como los sujetos pueden ser menores de edad, ese nivel de detalle re-identificador es exactamente lo que el RGPD (Art. 5(1)(c), minimización de datos) exige reducir. El programa declara el umbral k ≥ 5 — una convención estándar de control estadístico de divulgación (las celdas con menos de 5 individuos se consideran de alto riesgo de re-identificación) —, y la V1 lo incumple con margen.
El tratamiento generaliza la edad — la misma técnica que usó Sweeney: sustituir el valor exacto por un rango. Aquí, un tercil (b0/b1/b2, terciles de la distribución de edad). Dirección y tamaño de familia ya son “coarse” (solo dos valores cada uno) y no se tocan. El resultado: el mínimo de grupo sube de 1 a 27, con un intervalo de confianza bootstrap del 95% de [18, 37] — la banda entera por encima del umbral k ≥ 5. El gate cierra VERDE limpio.
§5b — ¿Y la equidad? Un control real que no se convirtió en gate
Sección titulada «§5b — ¿Y la equidad? Un control real que no se convirtió en gate»La disparidad de género fue el arco de una versión anterior de este guion — pero medida sobre un hold-out de apenas 99 estudiantes, una muestra tan pequeña que su intervalo de confianza cruzaba cualquier umbral razonable. A la muestra REAL y completa (1044 alumnos, con los 382 que cursan matemáticas Y portugués tratados como una sola persona vía student_cluster, no como dos registros independientes), la disparidad de género ya era pequeña en la V1 sin tratar (0,024) y baja algo más con el tratamiento fairlearn (0,014) — con un intervalo de confianza [0,001; 0,056] que nunca se acerca al umbral 0,08.
No hubo un rojo real que tratar en la equidad. Convertirla en gate habría exigido inflar el umbral, encoger la muestra o de alguna otra forma fabricar una disparidad que los datos no sostenían. En vez de eso, la equidad queda como un control audit certificado en verde — real, medido con 5-fold out-of-fold sobre la muestra completa, en el registro y en el paquete firmado — pero no el que decide el color del arco.
§6 — Los artículos, brevemente: Arts. 5, 9, 10, 13
Sección titulada «§6 — Los artículos, brevemente: Arts. 5, 9, 10, 13»Declarar high activa obligaciones reales. El motor proyecta el paquete firmado frente a ellas; aquí cada una en un párrafo, con una nota sobre qué está medido frente a solo declarado.
-
RGPD Art. 5(1)(c) — Minimización de datos. Es el arco de este nivel, y está medido:
minors-data-minimizationcalcula el k-anonimato real del trío edad/dirección/tamaño de familia y lo convierte en un gate bloqueante. No es prosa — es un número que cambia de verdad entre V1 y V2. -
Art. 9 — Gestión del riesgo. La columna vertebral del taller: identificar → analizar → evaluar → tratar → monitorizar, ejecutado como un bucle real con un control de minimización de datos bloqueante y un control de equidad certificado en paralelo. Ambos están medidos, no solo afirmados. (prEN 18228 es la norma escrita para operativizar exactamente este artículo.)
-
Art. 10 — Datos y gobernanza de datos. Los sistemas de alto riesgo deben usar datos relevantes, representativos y examinados en busca de sesgos y de riesgos de re-identificación. El conjunto de datos incluye un descriptor Croissant que declara el atributo protegido y los sesgos de datos conocidos — así que el Art. 10 está parcialmente medido (el k-anonimato y la paridad demográfica son reales) y parcialmente declarado (las prácticas más amplias de gobernanza de datos están indicadas en el manifiesto, auditadas en lugar de bloqueadas por barrera).
-
Art. 13 — Transparencia ante los usuarios. Los usuarios de un sistema de alto riesgo deben entender sus capacidades y límites. Esta es una medida declarada aquí (un control de auditoría/manual en el manifiesto,
accuracy-floorcomo única barrera de calidad), no una métrica con barrera bloqueante — y es precisamente el riesgo (risk.opacity) cuyo residual queda por encima del apetito, aceptado conscientemente en el hito de gobernanza. -
RGPD — consentimiento del niño, DPIA y no elaboración de perfiles (fuera del catálogo del motor). Los estudiantes pueden ser menores, y el RGPD sube el listón más allá de la minimización: condiciones del consentimiento del niño (Art. 8), DPIA obligatoria (Art. 35) y no elaboración de perfiles de menores mediante decisiones únicamente automatizadas (Art. 22 + considerando 71). El motor aún no proyecta estas tres piezas (no hay catálogo RGPD completo), así que se llevan como una medida atestada: declarada con evidencia y firmada en el paquete, pero no medida ni proyectada a conformidad. Es un hueco honesto parcial — la minimización de datos SÍ se mide (arriba); el resto del listón RGPD se reconoce en prosa, no se disfraza de barrera verificada.
La idea con la que quedarte: algunos artículos están respaldados por controles medidos y bloqueantes (Art. 5(1)(c) mediante el gate de minimización), otros por controles medidos pero certificados, no bloqueantes (la equidad), otros por controles declarados (Art. 13), y algunos deberes que el motor aún no proyecta del todo (el resto del RGPD para menores) se llevan como atestación, un hueco honesto. La proyección te muestra cuál es cuál — nunca disfraza una declaración (ni una atestación) como medición, ni un control certificado como el gate que decide el color.
§7 — Un paquete, muchas normas: la proyección
Sección titulada «§7 — Un paquete, muchas normas: la proyección»Aquí es donde las normas del §3 dan su fruto. Marta firmó un paquete de evidencia. A partir de él, froga conformance produce dos informes de conformidad — uno frente a ISO 23894, otro frente a prEN 18228 — con veredictos reales por cláusula: Cubierto, CubiertoAtestado, Parcial o Brecha. Sin volver a anotar, sin un segundo cuerpo de documentación: el mismo paquete se proyecta sobre el catálogo de cláusulas de cada norma. Y el mismo froga soa cruza el programa con el catálogo del Anexo A de ISO/IEC 42001 — el gate de minimización de datos aparece como control que implementa A.7.4 (calidad del dato).
Para cada artículo, el informe nombra la mayor autoridad que lo cubre y si esa autoridad concede presunción. Y esta es la parte honesta: porque prEN 18228 es un borrador armonizado (HarmonizedDraft), su indicador de presunción lee falso hoy — aunque sus veredictos sean reales. El sistema obtiene un proceso europeo genuino y proyectable ahora; ganará la presunción de conformidad automáticamente el día en que se cite la EN 18228 en el Diario Oficial, sin ningún cambio en la evidencia — solo cambia el indicador. (Si ese mecanismo no está claro, la página de fundamentos sobre normas y presunción recorre el arco de maduración.)
§8 — Anexo IV: parcial, por diseño (alcance, no completitud)
Sección titulada «§8 — Anexo IV: parcial, por diseño (alcance, no completitud)»El Anexo IV es la especificación de documentación técnica de la Ley de IA de la UE — el dossier que un proveedor de alto riesgo debe mantener. El motor lo ensambla a partir del paquete firmado: las partes respaldadas por evidencia (la descripción del sistema, el proceso de gestión del riesgo, los resultados del control de minimización de datos y de equidad) se generan, son reales y trazables.
Pero varias secciones del Anexo IV — §3.2, §5, §7 — están aún pendientes. El motor no las fabrica. Las marca como no-aún-ensambladas. Léelo correctamente: es alcance, no completitud. El Anexo IV que el motor produce hoy es un parcial verdadero — cada sección que muestra está derivada de evidencia, y cada sección que no puede respaldar aún está honestamente marcada como pendiente. Un dossier que pareciera completo rellenando huecos con prosa sería la versión deshonesta; este te dice exactamente hasta dónde llega la evidencia.