Inversión de modelo (Model inversion)
La inversión de modelo es un ataque que reconstruye rasgos representativos de los datos con los que se entrenó un modelo, usando solo el acceso a sus salidas. Cuando el conjunto de entrenamiento contenía datos personales, una inversión que funciona convierte un modelo desplegado en una divulgación de esos datos, lo que es un problema de privacidad antes que de seguridad.
La intuición es que un modelo que ha aprendido a reconocer algo ha codificado por el camino qué aspecto tiene ese algo. Optimizando una entrada para maximizar la confianza del modelo en una clase o en un individuo concreto, un atacante recupera algo que se parece a los ejemplos de entrenamiento de esa clase. La reconstrucción es aproximada y no exacta, y su calidad depende de la tarea, del modelo y de cuánto detalle devuelve la interfaz en su salida.
La razón de que importe comercialmente es regulatoria, no operativa. Si a un modelo entrenado con registros de clientes se le puede hacer producir rasgos reconocibles de esos registros, se puede sostener que el modelo trata datos personales en todos los sitios donde está desplegado, incluidos sitios a los que los datos nunca debían llegar: una copia entregada a un socio, un endpoint publicado para una aplicación móvil, o un modelo con ajuste fino guardado en un repositorio. Esa es una pregunta que un delegado de protección de datos tiene que poder responder.
Es una pregunta distinta de la inferencia de pertenencia, que pregunta si un registro concreto estaba en el conjunto de entrenamiento y no qué aspecto tenían los registros, y las dos son distintas del envenenamiento de datos de entrenamiento, que es un ataque al proceso de entrenamiento en lugar de al modelo ya terminado. Aclarar cuál de las tres se aplica a un despliegue concreto forma parte del trabajo de evaluación de IA que cubre qué se le puede hacer revelar a un modelo entrenado.