Membership inference
La membership inference es un ataque que determina si un registro concreto formó parte del conjunto de entrenamiento de un modelo, observando cómo responde el modelo ante él. Es la pregunta que hace un delegado de protección de datos cuando un modelo se ha entrenado con datos de clientes, porque una respuesta afirmativa es una revelación sobre una persona identificable.
La señal que explota es la confianza. Un modelo tiende a responder con más certeza ante datos que ha visto durante el entrenamiento que ante datos que no, y esa diferencia se puede medir desde fuera. Cuanto más sobreajustado esté el modelo a su conjunto de entrenamiento, mayor es la separación y más fiable la inferencia, y por eso este es uno de los pocos riesgos de privacidad que se encoge según el modelo generaliza mejor.
Que esto sea una revelación depende por completo de lo que signifique pertenecer. Saber que un registro estaba en un catálogo general de producto no interesa a nadie. Saber que un registro estaba en el conjunto de entrenamiento de un modelo construido a partir de historias clínicas, de impagos crediticios o de casos de fraude revela un hecho sobre esa persona, y lo hace sin que el atacante llegue a ver el registro.
Las mitigaciones se deciden antes de entrenar y no después: no entrenar con datos personales cuando serviría un conjunto derivado o agregado, limitar el sobreajuste, añadir ruido calibrado cuando el requisito de privacidad justifique el coste en precisión, y devolver etiquetas en vez de valores de confianza en la interfaz. El resultado práctico para un cliente suele ser un párrafo en una evaluación de impacto relativa a la protección de datos que diga si se probaron este riesgo y la inversión de modelo y qué se encontró, y producir eso forma parte de la evaluación de IA que contesta qué revela un modelo entrenado sobre su conjunto de entrenamiento.