Un podcast sobre cómo la Inteligencia Artificial está reescribiendo el desarrollo de softwareUn podcast sobre cómo la Inteligencia Artificial está reescribiendo el desarrollo de softwareUn podcast sobre cómo la Inteligencia Artificial está reescribiendo el desarrollo de softwareUn podcast sobre cómo la Inteligencia Artificial está reescribiendo el desarrollo de software
← Todos los episodios
1:34:10

Modelos Open Weight. Qué funciona y qué no.

Sobre este episodio

Hay demasiados modelos open weight y poca claridad sobre cuáles valen la pena para desarrollar software. Hoy traemos a Ronald Escalona para hablar de qué modelos correr, en qué hardware, para qué casos de uso y qué esperar de cada uno. Mientras Meta, Microsoft y NVIDIA firman cartas defendiendo los open weights, nosotros los ponemos a prueba. CHAPTERS 00:00 Modelos open-weight e inferencia empresarial 06:19 GPUs y centros de datos para inferencia local 12:49 APIs compatibles con OpenAI y costos por token 16:15 El negocio de vender tokens con valor agregado 22:12 Tokens, tokenomics y costo total de propiedad 24:34 Inferencia local vs. proveedores en la nube 29:46 Modelos abiertos más allá de China 36:28 Cómo elegir entre modelos grandes y especializados 39:09 Modelos densos, Mixture of Experts y KV cache 46:33 Inferencia subsidiada y dumping de precios 51:02 Open source vs. modelos de pesos abiertos 52:20 DeepSeek, chips chinos y competencia geopolítica 56:45 Destilación de modelos, licencias y regulación 1:04:52 Por qué seguirán bajando los costos de inferencia 1:09:12 vLLM y PagedAttention para servir modelos a escala 1:15:49 Nvidia, Qualcomm y la eficiencia energética de GPUs 1:22:03 La evolución del hardware de Nvidia para IA 1:29:23 KV cache para reducir latencia y facturación 1:31:25 Linux, Kubernetes y cuantización de modelos