Contenido mejorado: Los modelos de lenguaje han revolucionado el campo de la inteligencia artificial (IA), convirtiéndola en algo común en nuestra vida diaria. Con el aumento en la cantidad de modelos de IA disponibles, se vuelve más complicado determinar cuál es el más efectivo para diferentes tareas. Un reciente artículo publicado en la revista Science por científicos de Princeton, el MIT, Cambridge y Google DeepMind propone nuevas formas de evaluar y medir la eficiencia de los sistemas de IA, dejando atrás antiguas pruebas como el test de Turing y los rankings actuales. José Hernández-Orallo, director de investigación del Centro Leverhulme de la Universidad de Cambridge y catedrático de la Universidad Politécnica de Valencia, señala que la pregunta original de Turing sobre si una máquina puede pasar por un humano ya ha sido respondida afirmativamente. Además, destaca que la evaluación basada en hitos convierte la IA en una competencia por maximizar indicadores.
Comentarios