Un podcast sobre cómo la Inteligencia Artificial está reescribiendo el desarrollo de softwareUn podcast sobre cómo la Inteligencia Artificial está reescribiendo el desarrollo de softwareUn podcast sobre cómo la Inteligencia Artificial está reescribiendo el desarrollo de softwareUn podcast sobre cómo la Inteligencia Artificial está reescribiendo el desarrollo de software
← Todos los episodios
Próximo

Benchmarks de IA: Lo que te dicen, lo que esconden y como leerlos

Abrir en YouTube

Sobre este episodio

No hay nada más hypeado que un lanzamiento de SOTA model, y junto con las característica del modelo, un blog post técnico siempre vienen los gráficos con los benchmarks que miden el rendimiento de los modelos en diferentes dimensiones.... que no es raro que muestre los que son más favorables. La realidad es benchmarks van y benchmarks vienen, cada benchmark tiene su propia metodología además de que cada uno pone foco en diferentes dimensiones. Estos siempre pueden estar sujetos a entrenamiento específico para el benchmarks por parte del laboratorio, pueden envejecer mal con el tiempo, estar condicionados por otros factores como el harness o cómputo y claro a veces nos pintan una imagen que no está tan lejos de la realidad. Para este episodio decidimos meterle la lupa a los benchmarks, y entender realmente qué se está midiendo para los modelos de IA Generativa que son los que más nos interesan para el Desarrollo de Software.