Ingeniería de IA—ShareTwitterFacebookLinkedInKV cache quantization: el nuevo cuello de botella para correr agentes de IA en local (y cómo medirlo)Pasé horas depurando mi GPU. Te explico qué es el KV cache en transformers para lograr una inferencia de contexto largo local. ¡Te lo cuento todo!Published .