Resumen ejecutivo
¿Necesitas una GPU de dos mil dólares para usar IA, o alcanza con el hardware que tu empresa dio de baja? Ricardo Darío Matas no lo discutió en láminas: lo midió en vivo. Con tres computadoras recicladas y cero dólares en hardware nuevo levantó un stack completo —modelo de lenguaje, base vectorial, interfaz multiusuario y monitoreo— y obtuvo 6 tokens por segundo de un Llama 3.1 de 8 mil millones de parámetros. Pero el aporte más útil de la charla no es el número: es la fórmula de servilleta que permite a cualquiera calcular su techo de rendimiento antes de comprar nada, y la explicación de por qué el cuello de botella no son los gigahercios del procesador sino el ancho de banda de la memoria. Todo con un objetivo de fondo: soberanía tecnológica — el modelo corriendo en tu fierro, con tus datos, bajo tus reglas.
1. Por qué soberanía, y no solo ahorro
Matas plantea el problema desde la operación, no desde la teoría: "unos entrenan los modelos; otros los ponemos a trabajar". Y desde esa trinchera, depender de una API externa tiene tres costos que en América Latina pesan distinto que en el norte:
- Dólares por token. Cada consulta se paga en moneda dura. Con inflación local, el costo es impredecible — no es una línea de presupuesto, es una apuesta.
- Tus datos viajan. Historias clínicas, contratos, expedientes: cada prompt sale hacia un servidor extranjero.
- Permiso revocable. Cambios de términos, geobloqueos, sanciones. El servicio puede desaparecer mañana y tu proceso de negocio con él.
De ahí su definición operativa, sin épica: soberanía es que el modelo corra en TU fierro, con TUS datos, bajo TUS reglas.
2. El laboratorio: tres fierros, tres roles, cero dólares
El montaje es deliberadamente humilde y por eso convincente: remates, bajas de oficina, chatarra electrónica. Cada máquina vieja recibe un papel:
| Equipo | Software | Rol |
|---|---|---|
| Ryzen 5 3400G · 16 GB en doble canal · Proxmox 8.4 | Llama 3.1 8B · Qdrant · Open WebUI | Servidor de inferencia + RAG |
| APU A4 · 8 GB · año 2013 | Llama 3.2 1B · Whisper base | Nodo edge |
| Core Duo · 4 GB · sin AVX | Grafana | Monitoreo en vivo (tok/s, RAM, temperatura) |
Sobre eso corre un stack que no tiene nada de juguete: Proxmox con contenedores LXC —un servicio por contenedor, como en un datacenter—, Ollama sobre llama.cpp como motor de inferencia sirviendo por API REST, Qdrant como base vectorial para RAG y Open WebUI como interfaz multiusuario. Las mismas herramientas que en producción, a una fracción del costo.
3. El concepto que lo explica todo: mover bytes, no calcular
Acá está la idea que más gente necesita entender antes de comprar hardware. Para generar cada token, el procesador debe leer el modelo completo desde la RAM. Token 1: leer 4,9 GB. Token 2: leer 4,9 GB otra vez. Token 3: lo mismo. Y la caché del procesador no ayuda — con 4 MB frente a un modelo mil veces más grande, no hay nada que cachear.
El cuello de botella no son los GHz del CPU: es el ancho de banda de la memoria. El procesador pasa la mayor parte del tiempo esperando a la RAM. Por eso comprar un procesador más rápido casi no mueve la aguja, y sumar memoria más veloz sí.
De ahí sale la herramienta más práctica de toda la charla, que Matas llama la fórmula de servilleta:
tok/s (techo) = ancho de banda de RAM ÷ tamaño del modelo
Ryzen 3400G: 38,4 GB/s ÷ 4,9 GB (Llama 8B Q4) = 7,8 tok/s máximo físico
Con esa división, cualquiera puede estimar su techo antes de gastar un peso:
| Hardware | Ancho de banda | Techo con 8B Q4 |
|---|---|---|
| DDR4-2400 doble canal (este lab) | 38 GB/s | ~8 tok/s |
| DDR5-6000 doble canal | 96 GB/s | ~19 tok/s |
| Tesla P40 (2016, usada) | 346 GB/s | ~70 tok/s |
| RTX 3090 (usada) | 936 GB/s | ~190 tok/s |
La lectura que deja esa tabla es contraintuitiva y liberadora: una GPU de 2016 le gana nueve veces a un procesador moderno — por su memoria, no por sus núcleos. Traducido a decisiones de compra: en el mercado de usados hay más rendimiento por dólar del que sugiere el catálogo de lanzamientos.
4. Cuantización: el JPEG de los modelos
La segunda pieza técnica es la analogía más didáctica de la charla. Un modelo en su precisión original (FP16) ocupa 16 GB y no entra en la RAM de un equipo modesto. Comprimirlo a Q8 lo deja en 8,5 GB, "como un JPEG en calidad 95: indistinguible". Y Q4_K_M lo baja a 4,9 GB conservando alrededor del 97% de la calidad — un tercio del tamaño original.
El beneficio es doble, y aquí se cierra el círculo con el concepto anterior: el modelo entra en tu RAM y hay menos bytes que leer por token, así que también genera más rápido. Menos peso no es solo menos espacio: es más velocidad.
5. RAG local: la aplicación que justifica todo
Si la soberanía tiene una aplicación estrella, es esta: consultar tus propios documentos sin reentrenar nada y sin que salgan de tu red. El proceso tiene tres pasos: ingesta (documentos → fragmentos de 300 a 500 tokens → embeddings → base vectorial), búsqueda (la pregunta se convierte en vector y se recuperan los 3 a 5 fragmentos más cercanos por significado) y generación (esos fragmentos se inyectan en el contexto y el modelo responde citando tu material).
La demostración en vivo es el mejor argumento que existe contra las alucinaciones. Sin RAG, al preguntar qué dice el artículo 9 de la ley argentina 25.326, el modelo inventa un texto plausible, con número de artículo y todo — no sabe que no sabe. Con la ley indexada, responde citando el artículo textual correcto y su fuente. Todo el pipeline corre local: historias clínicas, expedientes y contratos nunca abandonan la red.
6. Antes de comprar, auditá lo que ya tenés
Una sección breve pero rentable: buena parte del rendimiento perdido no cuesta dinero recuperarlo. Verificar con dmidecode -t memory si la RAM está realmente en doble canal y a qué velocidad corre de verdad (en el lab, dos módulos de 8 GB funcionando a 2400 en vez de 2667 MT/s). Activar en la BIOS el perfil XMP o DOCP — es rendimiento que ya pagaste al comprar la memoria: +10% de tokens, gratis. Y ajustar el número de hilos a los núcleos físicos, no a los lógicos: hasta un 20% adicional según la carga. Todo medido antes y después en ese mismo hardware, no copiado del blog de alguien con una tarjeta de gama alta.
7. Los números que cierran en LATAM
en hardware nuevo: remates, bajas de oficina y e-waste
de consumo en inferencia — menos que una lámpara vieja. Medido, no estimado
salen de tu red: sin claves de API, sin términos de servicio, sin permiso de nadie
Y el resultado que da título a la charla: 6 tokens por segundo, sin nube, sin dólares, sin permiso de nadie. No es velocidad de frontera — es velocidad suficiente para un asistente interno, un buscador sobre documentos propios o un nodo de transcripción. El próximo salto coherente que propone Matas mantiene la lógica: una Tesla P40 usada de 24 GB, ancho de banda de datacenter a precio de remate.
8. Conclusiones
Tres ideas para llevarse. Primero, la fórmula manda: ancho de banda dividido por tamaño del modelo da tu techo real, y con esa división se evitan compras equivocadas de miles de dólares. Segundo, Q4_K_M es el punto dulce: 97% de la calidad en un tercio del tamaño, que además se traduce en más velocidad. Tercero, RAG local es la killer app de la soberanía: es donde la IA autoalojada deja de ser un experimento y pasa a resolver algo que la nube, por razones legales, muchas veces no puede resolver.
«Cada fierro viejo es un nodo de soberanía esperando su rol.» Para una región donde el hardware nuevo se paga en dólares y los datos sensibles están regulados por leyes locales, la conclusión de Matas es a la vez técnica y política: la IA soberana no es una utopía, es una decisión de arquitectura.
Referencias
- Matas, R. D. (2026). Mi lab casero para Dev IA: IA soberana con hardware reciclado [presentación]. I Congreso IA-LATAM. PDF de la charla.
- Matas, R. D. (2026). ¿Una PC vieja puede correr un LLM? IA soberana con hardware reciclado [video]. Canal de Comunidad IA LATAM en YouTube. youtube.com/watch?v=ezD6dG8Q3Lg.
- Stack utilizado en el laboratorio: Proxmox VE · Ollama sobre llama.cpp · Qdrant · Open WebUI · Grafana · Whisper.
- Ley 25.326 de Protección de los Datos Personales (Argentina), usada en la demostración de RAG.
- Sitio del autor: ricardodariomatas.ar.
Sobre el autor
Ricardo Darío Matas es administrador de sistemas en LasqueraBot (Argentina) y embajador de la Comunidad IA LATAM en su país. Trabaja desde el territorio de las operaciones: virtualización, redes, medición y puesta en producción — con foco en infraestructura de IA autoalojada y economía circular aplicada al hardware. LinkedIn · ricardodariomatas.ar
Artículo elaborado por la Comunidad IA LATAM a partir de la presentación oficial y la transcripción del video de la charla. Todas las mediciones citadas fueron realizadas por el autor sobre el hardware descrito y demostradas en vivo durante el congreso.