¿Qué es un riesgo?
Un riesgo es probabilidad por impacto
Sección titulada «Un riesgo es probabilidad por impacto»Empezamos por la idea, en una frase: un riesgo es la posibilidad de que algo salga mal, multiplicada por lo mucho que dolería si ocurriera. Siempre hay dos ingredientes:
- Probabilidad — ¿qué tan probable es el resultado negativo? (rara … casi segura)
- Impacto — si ocurre, ¿cuánto daña? (despreciable … catastrófico)
Perder en la lotería es muy probable pero de impacto mínimo; un meteorito es lo contrario. Ninguno es «un gran riesgo» por sí solo — solo lo sabes cuando pones los dos juntos. Por eso multiplicamos, conceptualmente, en vez de mirar cada número por separado.
Esta es la idea más antigua del campo, y es exactamente la que adopta el estándar internacional. ISO 31000 — el vocabulario de referencia para gestionar cualquier tipo de riesgo — define el riesgo como el «efecto de la incertidumbre sobre los objetivos», y ISO/IEC 23894 (su hermano de 2023 específico para inteligencia artificial, el estándar del que trata todo este curso) traslada ese vocabulario a los sistemas de aprendizaje automático (en inglés, machine learning). Cuando más adelante escribamos iso/23894@2023#6.4 queremos decir la cláusula 6.4 de ese estándar de 2023 — la parte dedicada al análisis del riesgo. Glosaremos cada referencia de este tipo la primera vez que aparezca; la idea siempre va primero, la referencia después.
El impacto es multidimensional
Sección titulada «El impacto es multidimensional»«¿Cuánto daña?» invita a la pregunta: ¿daña a quién? Un único número oculta la respuesta. Por eso leemos el impacto en tres ejes:
- Individual — daño a una persona (una solicitud de préstamo rechazada injustamente, un diagnóstico erróneo).
- Sociedad — daño a un colectivo o al público (un modelo que discrimina silenciosamente a todo un subgrupo).
- Organización — daño a las personas que construyen o explotan el sistema (una retirada de producto, una multa, un golpe reputacional).
El mismo fallo puede puntuar de forma muy distinta en cada eje. Un clasificador de flores que confunde dos especies no daña a ninguna persona y no pone en peligro a la sociedad — en el peor caso es un problema organizativo (el catálogo de un botánico es incorrecto). Nombrar los ejes te mantiene honesto sobre qué tipo de daño estás gestionando. La cláusula 6.4 de ISO 23894 («análisis del riesgo») pide exactamente esta lectura multidimensional, en lugar de una puntuación única agregada.
La matriz 5×5 y el nivel de un riesgo
Sección titulada «La matriz 5×5 y el nivel de un riesgo»Aquí va la intuición antes del formalismo: toma una escala de 5 pasos para la probabilidad (rara → improbable → posible → probable → casi segura) y una escala de 5 pasos para el impacto (despreciable → menor → moderado → mayor → grave), y colócalas sobre una cuadrícula. Donde la fila de probabilidad de un riesgo se encuentra con la columna de su impacto, el color de la celda es su nivel: bajo, medio, alto o crítico.
flowchart LR I["Identificar<br/>confusión de especies"] --> A["Analizar + Evaluar<br/>Probable × Moderado = ALTO<br/>(por encima del apetito)"] A --> T["Tratar<br/>añadir características del pétalo"] T --> R["Residual<br/>Improbable × Moderado = MEDIO<br/>(≤ apetito)"] R --> P["Aprobar<br/>Diego firma"]
El diagrama anterior es el bucle que recorrerás en un momento, aplicado a nuestro ejemplo floral. Léelo de izquierda a derecha: identificamos un riesgo (el modelo confunde dos especies), lo situamos en la matriz y obtenemos ALTO (probable que ocurra, impacto moderado), lo tratamos (damos al modelo mejores características), volvemos a medir para obtener un residual MEDIO que ya es aceptable, y solo entonces aprobamos. La matriz es solo la contabilidad que convierte dos palabras vagas («probable», «moderado») en un número comparable — un nivel que puedes comparar con una línea.
Esa línea es la siguiente idea.
Apetito: la línea que trazas antes de medir
Sección titulada «Apetito: la línea que trazas antes de medir»El apetito es cuánto riesgo estás dispuesto a aceptar — decidido de antemano, antes de ver ningún resultado. Es el criterio de aceptación. Lo escribes por eje de impacto, por ejemplo: «individual: BAJO, sociedad: BAJO, organización: MEDIO», lo que significa: toleramos hasta un riesgo organizativo MEDIO, pero nada por encima de BAJO que afecte a individuos o a la sociedad.
Trazar la línea primero es lo que mantiene honesta la gestión del riesgo. Si solo fijas el umbral después de ver el número, siempre estarás tentado de moverlo hasta donde caiga el modelo. El apetito es el compromiso que hace que un posterior «esto pasa» o «esto falla» signifique algo. En términos de ISO 23894 (cláusula 6.5, «evaluación del riesgo») es el umbral contra el que evalúas el riesgo analizado.
Inherente frente a residual — y por qué confirmamos el residual
Sección titulada «Inherente frente a residual — y por qué confirmamos el residual»Dos instantáneas del mismo riesgo, antes y después de actuar sobre él:
- Riesgo inherente — el riesgo tal como está hoy, sin tratar. (Nuestro clasificador de flores, entrenado solo con características débiles, confunde dos especies — ALTO.)
- Riesgo residual — lo que queda después de tratarlo. (Damos al modelo mejores características y la confusión se vuelve rara — MEDIO.)
El objetivo nunca es cero riesgo (eso no existe); es un residual en el apetito o por debajo. El tratamiento es cualquier cambio que hagas para llegar ahí — y, sobre todo, en este curso el tratamiento es un cambio versionado en git: un commit al que puedes apuntar.
Ahora la parte sutil. ¿Cómo sabes que el residual es realmente MEDIO y no un pensamiento ilusorio? Dos fuentes de verdad, y exigimos ambas:
- Declarado — una persona escribe en el manifiesto: «después de tratar esto, la probabilidad residual baja a improbable.» Eso es una afirmación.
- Confirmado por control — un control medible (aquí, una métrica de calidad) mide realmente el sistema tratado y confirma que la afirmación se cumple.
El residual híbrido es la regla que dice que el residual solo cuenta como real cuando la afirmación declarada está respaldada por un control que pasa. Una promesa que ninguna medición confirma es solo una promesa.
Si estás pensando «esto está muy bien, pero yo no clasifico flores» — ese es justamente el punto. La misma probabilidad × impacto que estás aprendiendo con Iris es la que separa un modelo de crédito que deniega una hipoteca en silencio mediante una variable indirecta (proxy) que nadie midió, de uno que de verdad puedes defender. El mismo bucle, lo que está en juego mayor — lee Por qué importa.
El bucle: identificar → analizar → evaluar → tratar → residual → monitorizar
Sección titulada «El bucle: identificar → analizar → evaluar → tratar → residual → monitorizar»Poner las piezas en orden te da el método completo como un único bucle:
- Identificar — nombra las cosas que podrían salir mal. (¿De dónde salen? Lo desarrolla De dónde nacen los riesgos, anclado en el art. 9(2) del EU AI Act.)
- Analizar — para cada una, estima la probabilidad y el impacto (la lectura 5×5).
- Evaluar — compara el nivel con tu apetito. ¿Por encima de la línea? Necesita tratamiento.
- Tratar — cambia algo (una característica, un parámetro, un proceso) para reducir la probabilidad o el impacto.
- Residual — vuelve a medir; confirma que el riesgo restante está ahora en el apetito o por debajo (el residual híbrido).
- Monitorizar — sigue observando, porque los datos y el mundo derivan; un residual que era válido puede degradarse.
Esa secuencia es el proceso de gestión de riesgos de ISO 23894 (cláusulas 6.4–6.5), y es la columna vertebral de cada nivel de este curso. Los mismos seis pasos se aplican tanto si el problema es una flor mal clasificada como si es un préstamo denegado — solo cambian los números.
Colores de barrera: ROJO, ÁMBAR, VERDE
Sección titulada «Colores de barrera: ROJO, ÁMBAR, VERDE»Cuando el motor evalúa un sistema tratado, cada control bloqueante devuelve uno de tres colores. La idea primero, el matiz después:
- VERDE — el control ha pasado, con suficiente confianza. El residual está confirmado en el apetito o por debajo. Se puede aprobar.
- ROJO — el control ha fallado. El residual está por encima del apetito. No apruebes; trátalo (o, si conscientemente aceptas el exceso, eso es una anulación registrada con un motivo obligatorio — se trata más adelante en el curso).
- ÁMBAR — el más honesto de los tres. El valor puntual puede parecer correcto, pero la medición tiene poca potencia (underpowered): no hay suficientes datos para demostrar que el residual es aceptable. El intervalo de confianza todavía cruza el umbral. ÁMBAR dice «aún no podemos saber», y la respuesta correcta es reunir más evidencia, no dejarlo pasar.
Un ejemplo resuelto: el riesgo de confusión de especies en Iris
Sección titulada «Un ejemplo resuelto: el riesgo de confusión de especies en Iris»Hagamos todo esto concreto sobre el ejemplo que ejecutarás en Nivel 1 · Iris.
El conjunto de datos Iris (Fisher, 1936 — 150 flores reales, tres especies, cuatro medidas cada una) es el problema de clasificación por excelencia. Tres especies: setosa es trivialmente fácil de distinguir, pero versicolor y virginica se solapan — son genuinamente similares en algunas medidas. Ese solapamiento es una propiedad real de las flores, no un obstáculo que hayamos inventado.
Recorramos el bucle:
- Identificar. El modelo podría confundir versicolor con virginica. Lo llamamos
risk.species-confusion. - Analizar. Un modelo entrenado solo con medidas de sépalo (el sépalo es la hoja exterior verde — la característica poco discriminativa) encuentra a versicolor y virginica casi indistinguibles. La confusión es probable; el impacto es moderado (solo organizativo — un catálogo incorrecto, nadie sufre daño). En la matriz: ALTO, por encima de nuestro apetito.
- Evaluar. El riesgo organizativo ALTO supera la línea de apetito (que fijamos en MEDIO para la organización). Necesita tratamiento.
- Tratar. Añadir las medidas de pétalo (el pétalo es la hoja interior de colores — y es la característica discriminativa: los pétalos separan a versicolor de virginica con claridad). Este es un cambio real, versionado en git: un simple cambio de parámetro que pasa de solo-sépalo a todas-las-características.
- Residual. Volver a medir. Con los pétalos en el modelo, la confusión se vuelve improbable; el residual cae a MEDIO, ahora en el apetito. El control — la exhaustividad macro (macro recall), una métrica de calidad, glosada en el Nivel 1 — lo confirma: pasa de estar por debajo de la barrera a estar por encima. Residual híbrido satisfecho.
- Monitorizar. El control se vuelve a ejecutar en cada commit futuro, así que si alguien elimina después las características del pétalo, la barrera se vuelve ROJA automáticamente.
La barrera pasa de ROJO (solo sépalo) a VERDE (con pétalos), y solo entonces se aprueba el sistema. En ningún paso intervino ninguna ley — lo hicimos porque es buena ingeniería, y porque nos proporciona evidencia firmada de que el riesgo realmente fue tratado.
¿Por qué un riesgo no es solo su probabilidad, o solo su impacto?
Porque cualquiera de los dos números por sí solo es engañoso. Un evento casi seguro pero trivial (perder una papeleta de lotería) y un evento casi imposible pero catastrófico (un meteorito) pueden parecer «extremos» en un eje mientras son insignificantes en conjunto. Un riesgo es probabilidad × impacto: solo sabes cuánto preocuparte cuando pesas qué probabilidad frente a qué gravedad. La matriz 5×5 es solo una forma de combinar los dos en un nivel comparable.
¿Cuál es la diferencia entre el riesgo inherente y el residual, y por qué el «residual» declarado no es suficiente por sí solo?
El riesgo inherente es el riesgo sin tratar, tal como está hoy; el riesgo residual es lo que queda después de tratarlo. El objetivo es un residual en el apetito o por debajo, no cero. Pero un residual declarado («lo hemos solucionado») es solo una afirmación. La regla del residual híbrido dice que solo cuenta cuando un control medible lo confirma realmente sobre el sistema tratado — declarado y confirmado por control. De lo contrario, tienes una promesa que ninguna medición respalda, que es donde se esconde el teatro del cumplimiento.
El valor puntual de un control supera el umbral, pero el motor muestra ÁMBAR. ¿Qué significa eso y qué debes hacer?
ÁMBAR significa que el resultado tiene poca potencia (underpowered): el valor puntual parece correcto, pero no hay suficientes datos para demostrar que el residual es aceptable — el intervalo de confianza todavía cruza el umbral. Es el honesto «aún no podemos saber». La respuesta correcta es reunir más evidencia (ampliar la cohorte, recoger más datos) y volver a medir, no tratar ÁMBAR como VERDE. Llamar verde a resultados con poca potencia sería el movimiento deshonesto; ÁMBAR existe precisamente para que no lo hagas.
A dónde ir ahora
Sección titulada «A dónde ir ahora»Ya tienes el vocabulario sobre el que funciona todo el curso. Ponlo en práctica con tres personas reales y un repositorio real, sobre el sistema más sencillo posible — flores, sin ley:
Nivel 1 · Iris — tu primer bucle de riesgo, sin ninguna ley →