Ir al contenido

Proyecto en curso · Inteligencia artificial

ExplAIn

Construimos herramientas para entender cómo decide una inteligencia artificial.

todavía confían en el modelo, después de haber visto la explicación
3 de 27
programas analizados, mitad malware y mitad limpios
420
niveles de riesgo en el AI Act europeo
4
el derecho a una explicación
Art. 86

Para quien viene de informática, matemáticas, filosofía, derecho

Participa en ExplAIn

Por qué explicar

Un modelo de inteligencia artificial da una respuesta, pero casi nunca dice por qué. Si la respuesta es correcta por el motivo equivocado, nadie se da cuenta hasta que ese motivo equivocado deja de funcionar.

Los métodos de explicación no cambian el modelo: le ponen al lado una herramienta de diagnóstico, que muestra qué partes de la entrada decidieron la respuesta. Así es como se encuentran los errores que no se ven.

El lobo y la nieve

En 2016, Ribeiro, Singh y Guestrin entrenaron a propósito un modelo equivocado: en todas las fotos de ejemplo los lobos estaban sobre la nieve y los husky no. El modelo aprendió la nieve: dice lobo si hay nieve, husky si no la hay, sea cual sea el animal que aparezca.

Su método, LIME, enciende y apaga grupos de píxeles y observa cómo cambia la respuesta, y después construye un modelo simple que imita al modelo real cerca de esa imagen. La explicación señala la nieve.

Mostraron las respuestas a 27 estudiantes con al menos un curso de machine learning. Antes de la explicación, 10 confiaban en el modelo; después, solo 3.

Qué cambia con la explicación. Sobre 27 personas. Ribeiro, Singh y Guestrin, KDD 2016. Los autores advierten de que la muestra es pequeña.
Los números del gráfico
Personasantes de la explicacióndespués
Confían en el modelo103
Señalan la nieve como indicio1225

Integrated Gradients

Otro método parte de una entrada neutra, por ejemplo una imagen negra, y llega a la entrada real en pequeños pasos. En cada paso mide cuánto es sensible la respuesta a cada parte de la entrada, y suma las contribuciones.

IG_i(x) = (x_i − x′_i) · ∫ de 0 a 1  ∂F(x′ + α·(x − x′)) / ∂x_i  dα

x    la entrada real          x′   la entrada neutra
F    el modelo                α    el paso, de 0 a 1

en la práctica: de 20 a 300 pasos, y la suma de las contribuciones debe dar F(x) − F(x′)
Sundararajan, Taly y Yan, ICML 2017.
  • 01

    Completitud

    Las contribuciones sumadas dan exactamente la diferencia entre la respuesta real y la neutra.

  • 02

    Sensibilidad

    Si cambiar una parte cambia la respuesta, esa parte recibe una contribución.

  • 03

    Independencia del código

    Dos redes que calculan la misma función tienen las mismas explicaciones.

  • 04

    Simetría

    Las partes intercambiables e iguales reciben la misma contribución.

El malware y los bytes que no cuentan

Algunos detectores de malware leen directamente los bytes de los programas Windows, y funcionan muy bien. ¿Pero en qué se basan? El estudio de Perasso y colegas, presentado en Ital-IA 2025, lo mide con Integrated Gradients en dos redes, MalConv y BBDNN, con 210 malware de siete familias y 210 programas limpios de Windows 11.

En un programa hay zonas que no deberían contar: la cabecera DOS, que se mantiene solo por compatibilidad; los espacios vacíos entre las secciones; los bytes añadidos al final. Y está el código real, la sección .text. Las dos redes dan la mayor parte de la relevancia al código, pero una parte considerable acaba en las zonas que no cuentan, sobre todo en los espacios vacíos de los programas limpios.

Cuánto pesan los espacios vacíos entre las secciones. Relevancia media asignada a los espacios vacíos entre las secciones del archivo. Perasso y colegas, Ital-IA 2025.
Los números del gráfico
Red y programasRelevancia media
MalConv (programas limpios)0,26
MalConv (malware)0,09
BBDNN (programas limpios)0,41
BBDNN (malware)0,11

La traducción del turco

En turco, el pronombre «o» vale tanto para él como para ella. Un estudio publicado en Science en 2017 mostró que, al traducir «O bir doktor. O bir hemşire.», Google Translate escribía «He is a doctor. She is a nurse.»: él médico, ella enfermera. El género no estaba en la frase, lo añadió el modelo, aprendiéndolo de los textos.

Desde diciembre de 2018, para frases breves del turco, Google muestra las dos traducciones. El sesgo estaba en los datos; para verlo hizo falta mirar dentro de las respuestas.

Las normas europeas

El AI Act, el reglamento europeo 2024/1689, está en vigor desde el 1 de agosto de 2024 y divide los sistemas de inteligencia artificial en cuatro niveles de riesgo. Para los de alto riesgo exige transparencia, supervisión humana, exactitud y robustez; y quien sufre una decisión tomada con su ayuda tiene derecho a una explicación, en el artículo 86.

  1. Riesgo inaceptable prohibido: puntuación social, manipulación, reconocimiento de emociones en la escuela y en el trabajo
  2. Alto riesgo educación, trabajo, servicios esenciales, infraestructuras críticas, dispositivos médicos
  3. Riesgo de transparencia los chatbots y los contenidos generados deben declararse
  4. Riesgo mínimo ninguna obligación: filtros antispam, videojuegos
Los cuatro niveles de riesgo. Del reglamento (UE) 2024/1689 y de las páginas de la Comisión Europea.
Los números del gráfico
Livello
Riesgo inaceptableprohibido: puntuación social, manipulación, reconocimiento de emociones en la escuela y en el trabajo
Alto riesgoeducación, trabajo, servicios esenciales, infraestructuras críticas, dispositivos médicos
Riesgo de transparencialos chatbots y los contenidos generados deben declararse
Riesgo mínimoninguna obligación: filtros antispam, videojuegos
  1. 21 de abril de 2021La Comisión Europea propone el reglamento.
  2. 1 de agosto de 2024El reglamento 2024/1689 entra en vigor.
  3. 2 de febrero de 2025Se aplican las prohibiciones.
  4. 2 de agosto de 2025Se aplican las normas sobre los modelos de IA de uso general.
  5. 27 de julio de 2026Entra en vigor el reglamento 2026/1744, que traslada los plazos para el alto riesgo.
  6. 2 de diciembre de 2027Obligaciones para los sistemas de alto riesgo de las áreas del anexo III, como educación y trabajo.
  7. 2 de agosto de 2028Obligaciones para la inteligencia artificial dentro de productos regulados, como los dispositivos médicos.

En qué punto estamos

  1. Junio de 2025En Ital-IA 2025, en Trieste, el estudio sobre las correlaciones espurias en la detección de malware: es uno de los tres casos del proyecto.
  2. Abril de 2026Presentamos el proyecto en Palazzo della Borsa, con tres casos: imágenes, ciberseguridad y traducciones.
  3. Próximo pasoUna caja de herramientas que cualquiera pueda reutilizar, lista para las normas europeas sobre inteligencia artificial.

Fotos

La presentación de ExplAIn en el escenario
Palazzo della Borsa, abril de 2026

Personas del proyecto

Con quién lo hacemos

  • Università di Genova
  • Legacoop Liguria

Todos los socios

Fuentes

  • Ribeiro, Singh y Guestrin, «Why Should I Trust You?», KDD 2016.
  • Sundararajan, Taly y Yan, Axiomatic Attribution for Deep Networks, ICML 2017.
  • Perasso, Lozza, Ponte, Demetrio, Oneto y Roli, Empirical Quantification of Spurious Correlations in Malware Detection, Ital-IA 2025, CEUR Workshop Proceedings 4121.
  • Caliskan, Bryson y Narayanan, Science, 2017; Google, Reducing gender bias in Google Translate, 2018.
  • Reglamento (UE) 2024/1689 y reglamento (UE) 2026/1744.
  • Presentación del Deep-Tech Showcase, Palazzo della Borsa, 21 de abril de 2026.

¿Quieres trabajar en ello?

No hace falta experiencia ni currículum. Escríbenos: te invitamos al próximo encuentro, donde conoces al equipo.

Participa en ExplAIn Todos los proyectos