Inteligencia artificial

Equidad en el aprendizaje automático: eliminación del sesgo de datos

La inteligencia artificial (IA) se basa completamente en los conjuntos de datos utilizados para entrenar sus modelos subyacentes de aprendizaje automático (ML).

Los desarrolladores construyen modelos ML a partir de conjuntos de datos de entrenamiento que recopilan y anotan. Los datos de entrenamiento informan al modelo ML para hacer predicciones sobre el mundo. Por lo tanto, cuanto mejores sean los datos anotados, mejores serán las predicciones.

Sin embargo, surgen problemas cuando los datos anotados son incorrectos o están distorsionados: los resultados no serán los esperados y el modelo predictivo fallará.

Los datos distorsionados se pueden atribuir a muchas cosas. Por lo general, esto significa que los datos están mal etiquetados, contienen errores y/o son de mala calidad. Pero las decisiones de clasificación humana también pueden crear distorsión; es una situación de «basura que entra, basura que sale».

Esta condición, la diferencia entre los datos y su representación más precisa, se denomina sesgo de datos. Puede tener consecuencias desastrosas para los modelos de ML y los sistemas de IA basados ​​en ellos. (Lea también: ¿Puede la IA estar sesgada?)

Aquí, veremos las fuentes de sesgo de datos, ejemplos del mundo real y lo que podemos hacer para eliminar el sesgo en la IA.

Sesgo en IA y aprendizaje automático

Como se mencionó anteriormente, el aprendizaje automático (ML) es la parte de la inteligencia artificial (AI) que ayuda a los sistemas a aprender y mejorar a partir de la experiencia sin la necesidad de una programación tradicional continua.

Cuando se insertan datos incorrectos en un sistema de ML, estos introducen «hechos» incorrectos en información útil. Como tal, el sesgo en la IA representa cómo los sistemas de análisis de datos basados ​​en el aprendizaje automático discriminan entre grupos específicos de personas. Dicha discriminación a menudo ocurre dentro de sesgos sociopolíticos establecidos, como, entre otros, raza, género, género designado, origen nacional y edad.

El sesgo ocurre cuando un algoritmo muestra resultados incorrectos debido a suposiciones incorrectas en el proceso de ML. Como tal, los sesgos de aprendizaje automático a menudo provienen de las personas responsables de diseñar y entrenar sistemas de aprendizaje automático; los sesgos de datos provienen de sesgos humanos. (Lea también: AI tiene alguna explicación que hacer.)

Cómo los datos malos dañan el aprendizaje automático

Los datos incorrectos pueden tener efectos desastrosos en los sistemas de aprendizaje automático. Los datos incompletos o faltantes, los datos incorrectos y el sesgo de datos son factores clave que pueden interrumpir los sistemas de aprendizaje automático. (Lea también: Las promesas y las trampas del aprendizaje automático).

ejemplo de la vida real

El sesgo del aprendizaje automático ha sido durante mucho tiempo un riesgo conocido. De hecho, se han encontrado sesgos de aprendizaje automático en casos del mundo real, y los sesgos pueden tener consecuencias negativas. Aquí hay tres ejemplos de este tipo:

1. Brújula (Análisis de la Gestión del Infractor Correccional para las Sanciones Alternativas).

COMPAS utiliza el aprendizaje automático para predecir la probabilidad de que un acusado reincida en el futuro. Este es el algoritmo que usan los jueces para ayudar a determinar la sentencia apropiada en varios estados y jurisdicciones de EE. UU.

Sin embargo, investigaciones posteriores encontraron que COMPAS era muy inexacta en sus predicciones de reincidencia de delitos violentos basadas en el tono de piel blanco o negro, algo que las empresas propietarias de COMPAS disputan. Esta investigación plantea preguntas sobre el uso de algoritmos de aprendizaje automático y cómo las fallas humanas, como el racismo, pueden conducir a deficiencias en el aprendizaje automático.

2. IBM Watson.

Se han dirigido muchas críticas a la supercomputadora Watson de IBM, especialmente a su incursión en la medicina. (Lea también: Los 20 principales casos de uso de IA: inteligencia artificial en el cuidado de la salud.)

La supercomputadora ganadora del premio ‘Dangerous’ analiza cientos de miles de estudios médicos para brindarles a los médicos consejos basados ​​en la investigación. Pero determinar qué estudios se favorecen, es decir, favorecer los estudios de buena reputación sobre aquellos que son defectuosos o sesgados, no es uno de los puntos fuertes del algoritmo. Esto da como resultado datos poco fiables.

Además, algunos se quejaron de que Watson estaba sesgado hacia el enfoque estadounidense para el diagnóstico y el tratamiento, y que Watson tenía problemas para entender las recetas escritas a mano por los médicos.

3. Inteligencia artificial de voz.

Sin duda, Voice AI se ha vuelto popular en los últimos años. Al buscar cualquier información en Google, las personas prefieren utilizar la función de búsqueda por voz en lugar de la búsqueda de texto tradicional.

Sin embargo, los modelos de inteligencia artificial del habla tienen un claro sesgo contra las mujeres. El reconocimiento de voz a menudo no funciona para las mujeres; este sesgo puede tener un impacto significativo en los usuarios. Por ejemplo, una mujer de habla inglesa con un alto nivel educativo reprobó una prueba de habilidades de habla de inmigración australiana utilizando IA de voz. (Lea también: Mujeres en IA: uso de la tecnología para reforzar el sexismo y los estereotipos.)

Los diferentes dialectos también afectan los conjuntos de datos para el reconocimiento de voz correcto. Estas fallas pueden ocurrir debido a razones tales como conjuntos de datos y análisis de datos incorrectos. Sin embargo, algunos especulan que la base de datos en sí incluye principalmente datos masculinos, sin voces femeninas ni dialectales.

Tipos de sesgo de aprendizaje automático

Hay varios factores que afectan el sesgo de aprendizaje automático.

Estas son algunas de las principales situaciones que crean sesgos en los modelos de aprendizaje automático:

sesgo de muestra

El sesgo de muestra ocurre cuando los datos utilizados para entrenar el algoritmo no representan perfectamente el espacio del problema en el que opera el modelo. En otras palabras, este tipo de sesgo ocurre cuando el conjunto de datos no muestra la realidad del entorno en el que operará el modelo.

Algunos ejemplos de sesgos simples podrían ser:

  • El sistema de reconocimiento facial se entrenó principalmente en imágenes de hombres blancos, pero se usó para identificar todos los géneros y tonos de piel.
  • Se espera que los automóviles autónomos operen tanto de día como de noche, pero solo se entrenen con datos nocturnos.

Sesgo algorítmico

El sesgo algorítmico ocurre cuando hay un problema interno Algoritmos para realizar cálculos Habilite los cálculos de aprendizaje automático.

Este tipo de sesgo no tiene nada que ver con los datos y nos recuerda que el «sesgo» es sobrecarga.

parcialidad

El sesgo, también conocido como prejuicio racial, tiende a dominar los titulares relacionados con las fallas de la IA porque a menudo afecta los asuntos culturales y políticos.

Este sesgo ocurre cuando los datos de entrenamiento están sujetos a posibles sesgos y/o sesgos de entrenadores humanos. Se debe pedir a los científicos de datos y a las empresas que se aseguren de que los algoritmos no produzcan resultados convencionales o sesgados. (Lea también: Por qué la diversidad es crucial para obtener datos de alta calidad para el entrenamiento de la IA.)

desviación de medición

La distorsión de los valores del sistema ocurre cuando el equipo de observación y/o medición encuentra un problema.

Este sesgo cambia los datos en una dirección particular; las mediciones incorrectas pueden dar lugar a datos mal formados. Este tipo de sesgo ocurre, por ejemplo, en conjuntos de datos de reconocimiento de imágenes, donde los datos de entrenamiento se recopilan con un tipo de cámara y los datos de producción se recopilan con una cámara diferente.

El sesgo de medición también puede ocurrir debido a una anotación imperfecta durante la fase de etiquetado de datos del proyecto.

sesgo de exclusión

El sesgo de exclusión ocurre cuando faltan o se omiten puntos de datos importantes de los datos que se utilizan. Esto también es común en la etapa de preprocesamiento de datos. La razón más común es la eliminación de datos valiosos que erróneamente se consideraron sin importancia.

sesgo del observador

También conocido como «sesgo de confirmación», el sesgo del observador ocurre cuando los observadores encuentran deliberadamente los resultados que esperan ver, independientemente del estado de los datos.

El sesgo del observador puede ocurrir cuando los investigadores se unen a un proyecto que presupone ideas basadas en su conocimiento subjetivo de investigaciones previas. También puede ocurrir cuando los etiquetadores usan su conocimiento subjetivo para controlar sus esfuerzos de etiquetado, lo que da como resultado datos imperfectos. (Lea también: ¿Cuáles son las preocupaciones éticas sobre el aprendizaje automático?)

sesgo de recuerdo

Este es un sesgo de medición que también es común durante la fase de etiquetado de datos.

El sesgo de recuerdo ocurre cuando tipos de datos similares se etiquetan de manera inconsistente. Esto afecta la precisión del resultado final.

Todos estos tipos de sesgos significan que los sistemas de IA siempre contienen algún error humano.

Equidad en el aprendizaje automático

La equidad en el aprendizaje automático se refiere al diseño o creación de algoritmos en un sistema de máquina que no está sujeto a ningún sesgo externo y que produce con precisión los resultados esperados.

Los conjuntos de datos de entrenamiento utilizados en los modelos de aprendizaje automático desempeñan un papel clave para ayudar a que un sistema funcione correctamente y sin problemas. (Lea también: Términos básicos de aprendizaje automático que debe conocer.)

Cómo eliminar el sesgo en el aprendizaje automático

Eliminar el sesgo de datos en el aprendizaje automático es un proceso continuo. Para establecer un proceso de recopilación de datos preciso y cuidadoso, los sesgos de datos y aprendizaje automático deben limpiarse casi constantemente.

La concienciación y la buena gobernanza pueden ayudar a prevenir el sesgo del aprendizaje automático. Esto se debe a que abordar el sesgo de datos requiere primero identificar dónde se produce el sesgo. Una vez localizado, el sesgo se puede eliminar del sistema. (Lea también: Automatización: ¿El futuro de la ciencia de datos y el aprendizaje automático?)

Sin embargo, a menudo es difícil de entender cuando los datos o los modelos están sesgados. Aún así, hay pasos que puede tomar para controlar la situación. Éstos incluyen:

  • Pruebas y validación para garantizar que los resultados del sistema de aprendizaje automático no estén sesgados por algoritmos o conjuntos de datos.
  • Asegúrese de que el grupo de científicos de datos y etiquetadores de datos sea diverso.
  • Establezca pautas estrictas para las expectativas de etiquetado de datos para que los etiquetadores de datos tengan pasos claros a seguir al anotar.
  • Agregue información de múltiples fuentes para garantizar la diversidad de datos.
  • Analice regularmente los datos y registre los errores para que pueda resolver los problemas lo más rápido posible.
  • Busque la ayuda de cualquier experto en el dominio para revisar los datos recopilados y anotados. Las personas ajenas al equipo pueden notar un sesgo descontrolado.
  • Utilice recursos externos como la herramienta What-if de Google o el kit de herramientas de código abierto AI Fairness 360 de IBM para inspeccionar e inspeccionar modelos de aprendizaje automático.
  • Implemente anotaciones multicanal para cualquier elemento en el que el refinamiento de datos pueda estar sesgado.

pensamientos finales

Las máquinas necesitan una gran cantidad de datos para aprender; anotar con precisión los datos de entrenamiento es tan importante como el propio algoritmo de aprendizaje.

Una razón común por la que los modelos de ML no funcionan a la perfección es que se crearon en base a datos de entrenamiento sesgados e imperfectos. Entonces, ¿cómo resolvemos este problema?

Aquí hay algunas sugerencias:

  • Los datos de entrenamiento deben ser precisos y de alta calidad para eliminar sesgos.
  • Las organizaciones deben contratar equipos técnicos con diferentes miembros, tanto para construir modelos como para crear datos de entrenamiento. (Lea también: Smart HR: cómo la IA está transformando la adquisición de talento.)
  • Si un sistema interno produce datos de entrenamiento, debe encontrar los datos más completos y probar diferentes conjuntos de datos y métricas.
  • Si los socios externos recopilan datos de capacitación, se deben reclutar recursos colectivos distribuidos para el etiquetado de datos.
  • Es fundamental verificar si hay sesgos implícitos después de crear los datos de entrenamiento.

LEER
En un mundo de cambio climático, ¿cómo puede la IA ayudar a prepararse para las inundaciones?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Botón volver arriba