Quien conoce las bases de la Inteligencia Artificial (IA) sabe lo fundamental que es el dato para la formación en Machine Learning o Deep Learning. Sin embargo, el enfoque más utilizado hasta ahora por quienes diseñan este tipo de soluciones se centra en el modelo. En este artículo mostraremos la otra cara de la moneda: el enfoque de Data-centric.
Que quede claro que el nuevo enfoque centrado en los datos no reemplaza al centrado en el modelo. De hecho, el éxito de una Inteligencia Artificial radica en equilibrar ambas.
¿Cuáles son las diferencias entre el enfoque centrado en el modelo y el centrado en los datos?
Enfoque Model-centric
Este enfoque implica el desarrollo de investigación experimental con el objetivo de mejorar el modelo de Machine Learning. Los datos permanecen sin cambios ya que solo trabaja en el código o en la arquitectura del modelo. Encontrar la solución adecuada no es fácil, dado el amplio abanico de posibilidades a reducir por ensayo y error.
Enfoque Data-centric
El enfoque centrado en los datos parte del supuesto de que para aumentar la precisión de las aplicaciones de aprendizaje automático es necesario partir del conjunto de datos. ¡Tenemos en cuenta que la cantidad no lo es todo! De hecho, este enfoque trabaja en la mejora sistemática de los datos.
Las características del enfoque Data-centric
Datos orientados a objetivos
En primer lugar, para tener un conjunto de datos eficiente es importante que los datos estén orientados hacia un objetivo. Tomemos un ejemplo trivial de una Inteligencia Artificial que debe reconocer abetos. Las fotos del árbol no serán suficientes, ya que durante el período cercano a las fiestas navideñas, muchos de estos tendrán luces y adornos. Si queremos reconocer estos también, será necesario encontrar el equilibrio adecuado de datos para que la computadora entienda que los abetos con decoraciones también forman parte de la categoría, pero que no todos los árboles que tienen decoraciones son abetos. Si absurdamente quisiéramos reconocer no solo abetos reales, sino también pintados, necesitaríamos aún otros datos de otro tipo. Dependerá por tanto del objetivo que queramos conseguir a través de la Inteligencia Artificial. Cuanto más específicos sean los datos sobre las diversas excepciones que queremos identificar, más preciso será el modelo.
Etiquetado de datos
Segundo punto: los datos deben estar etiquetados correctamente. El etiquetado es el proceso de asignar una o más etiquetas a los datos. Por ejemplo, en una foto donde hay un perro, insertaré la etiqueta de «perro» en el área donde está el animal, para que la máquina aprenda a reconocerlo. Si entrenamos un modelo sobre un conjunto de datos con un número significativo de imágenes etiquetadas incorrectamente, el resultado será una Inteligencia Artificial que no funcionará correctamente. Por el contrario, si etiquetamos las imágenes correctamente tendremos un modelo más preciso que necesitará menos datos para aprender. En el enfoque centrado en los datos, por lo tanto, el enfoque está en la calidad y no en la cantidad de datos.
Conjunto de datos representativo de la realidad
Tercera característica: para que un modelo funcione, el conjunto de datos debe ser representativo de la realidad. Sin embargo, la realidad es relativa y dependiente del tiempo. Esto significa que el conjunto de datos debe actualizarse para representar continuamente la realidad. Por ejemplo, si entrenamos un modelo para el reconocimiento de automóviles, es posible que después de unos años no sea capaz de reconocer los últimos modelos de automóviles si estos difieren particularmente de los existentes en el momento en que se creó el modelo.
Entendemos que Machine Learning o Deep Learning es algo que va más allá del algoritmo. Los datos no son solo la base desde la que empezar, sino el factor habilitador de la Inteligencia Artificial.