Lo que me enseñó un modelo con un 50% de acierto


Foto de Kay Nauwelaerts en Unsplash
Construimos una app de triaje de cáncer de piel en una semana y ganamos un premio de presentación. El modelo acertaba en torno al 50%. Las dos cosas van en el informe.
Dos cosas ciertas
En una semana, un equipo del que formé parte entregó una aplicación funcional de triaje de cáncer de piel: una ResNet50 reentrenada por transferencia sobre 2.500 imágenes del archivo ISIC en cinco clases, una interfaz y una base de datos detrás. La presentamos y ganó el Biomedical Engineering Presentation Award con un 86%.
El modelo alcanzó en torno a un 50% de acierto sobre cinco clases, con un conjunto de datos que tiene un sesgo bien documentado hacia la piel clara.
Las dos frases son ciertas, y la pregunta interesante es qué haces con la segunda.
La versión fácil
La versión fácil de este proyecto en un CV dice: desarrollé una app de triaje de cáncer de piel con IA y explicabilidad, premiada con un 86%. Cada palabra es defendible. Y el conjunto, sin embargo, induce a error, porque quien lo lea asumirá que la cosa funciona, y no funciona lo bastante bien como para acercarla a un paciente.
Un 50% de acierto sobre cinco clases con un conjunto sesgado no es una herramienta clínica. Es la demostración de que un pipeline funciona de principio a fin.
Lo que el proyecto demostró de verdad
Algo que sí merece reivindicarse, en cuanto dejas de exagerar:
- Un equipo puede llevar un modelo, una interfaz y una capa de datos de cero a funcionando en una semana.
- El problema de integración —meter una red entrenada dentro de algo que una persona pueda usar— es trabajo real, y fue mi parte.
- Un conjunto de entrenamiento sesgado produce un modelo sesgado, y eso se descubre midiendo, no confiando.
Ese último punto es el que me llevo puesto. El sesgo hacia la piel clara del conjunto está documentado y es conocido. Aun así sorprendió lo directamente que apareció.
Saber lo que tu sistema no es lo bastante bueno para hacer es un resultado aparte, y hay que enunciarlo aparte.
Separar las afirmaciones
La costumbre que me llevé: enunciar la afirmación de entrega y la de rendimiento por separado, y no dejar nunca que la primera implique la segunda.
«Construimos esto en una semana» y «esto acierta lo suficiente como para fiarse» son afirmaciones distintas con evidencias distintas. Fusionarlas es como una demo acaba descrita como un producto, y en aplicaciones médicas esa distancia no es un problema de presentación, es de seguridad.