Modelos Open Weight. Qué funciona y qué no.
Sobre este episodio
Hay demasiados modelos open weight y poca claridad sobre cuáles valen la pena para desarrollar software. Hoy traemos a Ronald Escalona para hablar de qué modelos correr, en qué hardware, para qué casos de uso y qué esperar de cada uno. Mientras Meta, Microsoft y NVIDIA firman cartas defendiendo los open weights, nosotros los ponemos a prueba. CHAPTERS 00:00 Modelos open-weight e inferencia empresarial 06:19 GPUs y centros de datos para inferencia local 12:49 APIs compatibles con OpenAI y costos por token 16:15 El negocio de vender tokens con valor agregado 22:12 Tokens, tokenomics y costo total de propiedad 24:34 Inferencia local vs. proveedores en la nube 29:46 Modelos abiertos más allá de China 36:28 Cómo elegir entre modelos grandes y especializados 39:09 Modelos densos, Mixture of Experts y KV cache 46:33 Inferencia subsidiada y dumping de precios 51:02 Open source vs. modelos de pesos abiertos 52:20 DeepSeek, chips chinos y competencia geopolítica 56:45 Destilación de modelos, licencias y regulación 1:04:52 Por qué seguirán bajando los costos de inferencia 1:09:12 vLLM y PagedAttention para servir modelos a escala 1:15:49 Nvidia, Qualcomm y la eficiencia energética de GPUs 1:22:03 La evolución del hardware de Nvidia para IA 1:29:23 KV cache para reducir latencia y facturación 1:31:25 Linux, Kubernetes y cuantización de modelos


