IA en entornos reales: el gran reto ya no es el rendimiento, sino la fiabilidad

Guardar

Los métodos tradicionales de evaluación de IA quedan obsoletos ante el avance de los modelos (Imagen Ilustrativa Infobae)

La i nteligencia artificial (IA) avanza a un ritmo vertiginoso, pero la pregunta fundamental sobre su verdadero alcance sigue sin respuesta clara: ¿Cómo evaluar si un modelo de IA es realmente eficaz? Según un análisis de MIT Technology Review, la industria enfrenta una crisis de evaluación, ya que los métodos tradicionales para medir el rendimiento de estos sistemas quedaron obsoletos.

Mientras los modelos superan pruebas estandarizadas, investigadores y empresas exploran nuevas formas de medir capacidades más allá de las puntuaciones, con el objetivo de reflejar su impacto real y los riesgos asociados.

Durante años, la comunidad de IA confió en benchmarks, pruebas estandarizadas que permiten comparar modelos mediante puntuaciones objetivas. Estas herramienta evalúan la cantidad de respuestas correctas.

Sin embargo, este enfoque perdió vigencia. Modelos de renombre como ChatGPT, DeepSeek, y los desarrollos de Anthropic y Google aprendieron a optimizar sus respuestas para destacar en estas pruebas, sin necesariamente mejorar en habilidades generales o transferibles.

Expertos advierten sobre la necesidad de evaluar creatividad, fiabilidad y riesgos en inteligencia artificial de gigantes tecnológicos (AP Foto)

Otro obstáculo es la contaminación de datos, ya que algunos modelos accedieron a preguntas y respuestas de pruebas durante su entrenamiento, lo que facilita la memorización en lugar del razonamiento.

En evaluaciones como SuperGLUE, los modelos alcanzaron o superaron el 90% de precisión, un umbral que, según el portal MIT Technology Review, convierte cualquier mejora posterior en ruido estadístico más que en un progreso sustancial.

Esta saturación resulta especialmente problemática en áreas complejas como la programación, el razonamiento lógico y la resolución de problemas STEM (ciencia, tecnología, ingeniería y matemáticas). Andrej Karpathy, exintegrante de OpenAI y Tesla AI, advirtió: “Vivimos una crisis de evaluación”, en referencia a la incapacidad de los indicadores actuales para analizar la inteligencia artificial.

El especialista y ex integrante de OpenAI, Andrej Karpathy, señaló que actualmente la tecnología atraviesa una crisis de evaluación (AP)

Ante este escenario, diversos equipos comenzaron a desarrollar métodos alternativos para superar las limitaciones actuales. Uno de los más destacados es LiveCodeBench Pro, un benchmark basado en problemas de olimpiadas internacionales de algoritmos, competiciones donde estudiantes avanzados resuelven desafíos sin asistencia externa.

El proyecto es liderado por Zihan Zheng, estudiante de la Universidad de Nueva York (NYU) y finalista en competencias de programación, junto a un equipo de medallistas olímpicos. Modelos como GPT-4-mini-high y Gemini 2.5 de Google alcanzan resultados comparables al 10% superior de los competidores humanos, aunque solo logran un 53% de aciertos en problemas de dificultad media y 0% en los más complejos.

“Aún están lejos de igualar a los mejores programadores humanos”, señaló quien encabeza el nuevo método de medición, revelando que los sistemas muestran buen desempeño en planificación y ejecución, pero todavía no presentan resultados definitivos.

Si bien LiveCodeBench Pro marca un nuevo estándar para medir la capacidad máxima de los modelos, no aborda todos los aspectos relevantes. Recientemente, investigadores de diversas universidades propusieron evaluar a los agentes de IA también según su nivel de riesgo, no solo su rendimiento. En entornos reales, la fiabilidad es crucial: errores, alucinaciones o respuestas impredecibles pueden tener consecuencias significativas.

Modelos de gran renombre en la comunidad científica, como Gemini 2.5 de Google, disminuyen sus rendimientos al ser analizados por estudiantes avanzados y sin asistencias (Google)

Más allá de los nuevos benchmarks, surgieron técnicas alternativas para evaluar la IA. Uno de ellos es ARC-AGI, que mantiene parte de su conjunto de datos privado para evitar que los modelos se adapten excesivamente a las pruebas, un fenómeno conocido como “overfitting”.

Por su parte, Yann LeCun, científico jefe de IA en Meta, impulsado el método LiveBench, un tipo de benchmark dinámico con preguntas renovadas cada 6 meses, ideado para medir tanto conocimiento como adaptabilidad.

La evaluación basada en preferencias humanas también gana terreno. Plataformas como LMarena permiten comparar respuestas de distintos modelos y seleccionar la más adecuada según el juicio de los usuarios.

No obstante, estos método también tienen limitaciones: los usuarios podrían preferir respuestas agradables, aunque sean incorrectas, incentivando a los modelos a suavizar sus respuestas y desvirtuar los resultados.

En el ámbito académico, la presión por obtener resultados notorios rápidamente generó una cultura hipercompetitiva. Durante la conferencia CVPR, un destacado profesor de la NYU, criticó esta dinámica usando la metáfora de los “juegos finitos e infinitos” del historiador James Carse.

Según el especialista, la investigación en IA se transformó en una carrera de corto plazo que prioriza la velocidad sobre el conocimiento profundo. “Si la academia elige jugar un juego finito, lo perderá todo”, advirtió en sus declaraciones.

La presión académica y la cultura hipercompetitiva dificultan la investigación profunda en inteligencia artificial (Imagen Ilustrativa Infobae)

Pese a los avances y la proliferación de nuevos benchmarks, la comunidad científica coincide en que aún no existe un sistema de evaluación integral que abarque todas las dimensiones relevantes de la inteligencia artificial.

Aspectos como la creatividad, la experiencia del usuario común y las habilidades interdisciplinarias siguen siendo difíciles de medir objetivamente. Al mismo tiempo, la fiabilidad y los peligros inherentes al uso de IA en contextos reales continúan generando preocupación.

Mediante la aparición de nuevos métodos y pruebas se refleja un cambio de enfoque en la industria, pero también la necesidad de mantener el escepticismo y promover la mejora continua. Mientras que la IA sigue evolucionando, la búsqueda de una evaluación justa, rigurosa y útil se mantiene como uno de los principales desafíos.

Evaluación de inteligencia artificial Creatividad en IA Benchmarks Inteligencia Artificial IA Tecnología Seguridad tecnológica OpenAI Gemini Newsroom BUE Magazines

Últimas Noticias

El uso excesivo de pantallas podría afectar el sueño y la salud mental de adolescentes, según un estudio

Un análisis reciente sugiere que la exposición prolongada a dispositivos electrónicos puede alterar los patrones de descanso nocturno. Cómo impacta en el bienestar de los jóvenes

La sobrepesca transformó la evolución y el tamaño del bacalao en el Báltico oriental en las últimas décadas, según un estudio

Cambios inesperados en la estructura genética y física de una especie clave generan inquietud entre científicos y conservacionistas por el futuro del ecosistema marino europeo

Científicos revelan cómo era el cerebro de un dinosaurio gigante

Se trata de un trabajo de expertos del CONICET. El uso de tomografía computada y programas de modelado 3D permitió analizarlo en profundidad. La palabra de uno de los autores a Infobae

Cuál fue el fósil ignorado por 20 años que escondía una nueva especie prehistórica

Se trata del Bolg amondol, un reptil blindado con rasgos únicos que habitó los bosques tropicales de Laramidia hace 76 millones de años, según publicó Muy Interesante

Descubren el gen clave que permitió a la peste negra sobrevivir durante más de mil años

Nuevos hallazgos científicos explican cómo una modificación genética ayudó a la bacteria Yersinia pestis a sobrevivir a lo largo de los siglos, según reportó la revista Muy Interesante

MÁS NOTICIAS

IA en entornos reales: el gran reto ya no es el rendimiento, sino la fiabilidad

Innovadores métodos y herramientas buscan superar los límites de los sistemas clásicos. El MIT Technology Review informó con expertos que advierten sobre la importancia de valorar creatividad, fiabilidad y riesgos en tecnologías avanzadas

Crisis de evaluación: límites de los benchmarks tradicionales

Nuevos benchmarks y enfoques: hacia una evaluación más realista

Desafíos tecnológicos: creatividad y cultura de la investigación

Retos que persisten: riesgos y búsqueda de una evaluación integral

Últimas Noticias

El uso excesivo de pantallas podría afectar el sueño y la salud mental de adolescentes, según un estudio

Un análisis reciente sugiere que la exposición prolongada a dispositivos electrónicos puede alterar los patrones de descanso nocturno. Cómo impacta en el bienestar de los jóvenes

La sobrepesca transformó la evolución y el tamaño del bacalao en el Báltico oriental en las últimas décadas, según un estudio

Cambios inesperados en la estructura genética y física de una especie clave generan inquietud entre científicos y conservacionistas por el futuro del ecosistema marino europeo

Científicos revelan cómo era el cerebro de un dinosaurio gigante

Se trata de un trabajo de expertos del CONICET. El uso de tomografía computada y programas de modelado 3D permitió analizarlo en profundidad. La palabra de uno de los autores a Infobae

Cuál fue el fósil ignorado por 20 años que escondía una nueva especie prehistórica

Se trata del Bolg amondol, un reptil blindado con rasgos únicos que habitó los bosques tropicales de Laramidia hace 76 millones de años, según publicó Muy Interesante

Descubren el gen clave que permitió a la peste negra sobrevivir durante más de mil años

Nuevos hallazgos científicos explican cómo una modificación genética ayudó a la bacteria Yersinia pestis a sobrevivir a lo largo de los siglos, según reportó la revista Muy Interesante

SEP sorprende a estudiantes y anuncia dos puentes vacaciones antes de terminar el ciclo escolar: estas son las fechas

Dictaron prisión preventiva para el cuarto detenido por el secuestro extorsivo de un joven con discapacidad en Santa Fe

Alerta por posible crecida del río de La Plata: el SHN estimó niveles por encima de las tablas de marea para la madrugada del viernes

Evita sanciones en Medellín: consulta si puedes circular con tu vehículo

España: las predicciones del tiempo para Valencia este 27 de junio

Docentes y alumnos prenden antorchas en defensa de la universidad pública en Argentina

Zelaya tilda de “hecho trágico” matanza de Los Horcones y defiende inocencia de su padre

Astronautas chinos completan su segunda caminata espacial en la misión Shenzhou-20

Presidenta de México afina detalles con gobernadores de sedes del Mundial 2026

Sánchez defiende que sigue comprometido con la OTAN pese a no gastar el 5%, pero no hace "seguidismo ciego" como Feijóo

ENTRETENIMIENTO

La despedida viral de un chef animado tras la cancelación de su programa conmovió a millones en redes

Esta actriz audicionó seis veces por el papel de “Wicked” que terminó en manos de Ariana Grande

Modelo se sometió a procedimiento estético para conseguir el cuello de Kris Jenner y acabó con inflamación severa

Devyn LaBella lanzó nuevas acusaciones contra Kevin Costner por escena de abuso no consensuada en “Horizon 2″

¿Marge Simpson realmente murió? Esto es lo que se sabe del supuesto final de la serie

Crisis de evaluación: límites de los benchmarks tradicionales

Nuevos benchmarks y enfoques: hacia una evaluación más realista

Desafíos tecnológicos: creatividad y cultura de la investigación

Retos que persisten: riesgos y búsqueda de una evaluación integral

Temas Relacionados

Últimas Noticias

El uso excesivo de pantallas podría afectar el sueño y la salud mental de adolescentes, según un estudio

Un análisis reciente sugiere que la exposición prolongada a dispositivos electrónicos puede alterar los patrones de descanso nocturno. Cómo impacta en el bienestar de los jóvenes

La sobrepesca transformó la evolución y el tamaño del bacalao en el Báltico oriental en las últimas décadas, según un estudio

Cambios inesperados en la estructura genética y física de una especie clave generan inquietud entre científicos y conservacionistas por el futuro del ecosistema marino europeo

Científicos revelan cómo era el cerebro de un dinosaurio gigante

Se trata de un trabajo de expertos del CONICET. El uso de tomografía computada y programas de modelado 3D permitió analizarlo en profundidad. La palabra de uno de los autores a Infobae

Cuál fue el fósil ignorado por 20 años que escondía una nueva especie prehistórica

Se trata del Bolg amondol, un reptil blindado con rasgos únicos que habitó los bosques tropicales de Laramidia hace 76 millones de años, según publicó Muy Interesante

Descubren el gen clave que permitió a la peste negra sobrevivir durante más de mil años

Nuevos hallazgos científicos explican cómo una modificación genética ayudó a la bacteria Yersinia pestis a sobrevivir a lo largo de los siglos, según reportó la revista Muy Interesante

SEP sorprende a estudiantes y anuncia dos puentes vacaciones antes de terminar el ciclo escolar: estas son las fechas

Dictaron prisión preventiva para el cuarto detenido por el secuestro extorsivo de un joven con discapacidad en Santa Fe

Alerta por posible crecida del río de La Plata: el SHN estimó niveles por encima de las tablas de marea para la madrugada del viernes

Evita sanciones en Medellín: consulta si puedes circular con tu vehículo

España: las predicciones del tiempo para Valencia este 27 de junio

Docentes y alumnos prenden antorchas en defensa de la universidad pública en Argentina

Zelaya tilda de “hecho trágico” matanza de Los Horcones y defiende inocencia de su padre

Astronautas chinos completan su segunda caminata espacial en la misión Shenzhou-20

Presidenta de México afina detalles con gobernadores de sedes del Mundial 2026

Sánchez defiende que sigue comprometido con la OTAN pese a no gastar el 5%, pero no hace "seguidismo ciego" como Feijóo

ENTRETENIMIENTO

La despedida viral de un chef animado tras la cancelación de su programa conmovió a millones en redes

Esta actriz audicionó seis veces por el papel de “Wicked” que terminó en manos de Ariana Grande

Modelo se sometió a procedimiento estético para conseguir el cuello de Kris Jenner y acabó con inflamación severa

Devyn LaBella lanzó nuevas acusaciones contra Kevin Costner por escena de abuso no consensuada en “Horizon 2″

¿Marge Simpson realmente murió? Esto es lo que se sabe del supuesto final de la serie