La IA dejó de vivir solo en centros de datos. Ahora también vive en el escritorio.
Desconecta el wifi y pídele a ChatGPT que te resuma un contrato. No pasa nada: sin internet no hay inteligencia artificial. Eso era cierto hasta hace poco. Hoy, en el computador desde el que escribimos este artículo, la IA sigue respondiendo con el cable desenchufado.
Eso es la IA local: un modelo de lenguaje que vive dentro de tu equipo y calcula ahí mismo, sin mandar una sola palabra a un servidor ajeno. Llevamos meses trabajando con ella a diario en santa marta crea, y lo que ha cambiado en el último año merece contarse. Aquí va lo que hay al alcance, qué puedes correr con el equipo que ya tienes, y qué nos hemos encontrado montando el nuestro — incluidas las cosas que descartamos. Si te interesa el panorama grande, complementa con nuestro análisis del impacto de la IA en el mercado laboral hacia 2030.
La IA local es un modelo de lenguaje que se descarga y se ejecuta en tu propio equipo, sin conexión y sin que los datos salgan de ahí. Dejó de ser un experimento por tres cambios simultáneos: los modelos abiertos de calidad se volvieron pequeños (Google publicó Gemma 4 en abril de 2026 con versiones que corren hasta en una Raspberry Pi), la arquitectura de mezcla de expertos permite que un modelo de 35 mil millones de parámetros active solo 3 mil millones en cada palabra, y la cuantización reduce su peso a una fracción sin arruinar la calidad. Lo que decide qué puedes correr no es el procesador sino la memoria: con 16 GB ya entra un modelo de trabajo real. En nuestra prueba de junio de 2026, sobre un Mac Studio con 64 GB de memoria unificada y el modelo abierto Qwen3.6-35B-A3B cuantizado a 4 bits, medimos 97,7 tokens por segundo: unas quince veces la velocidad de lectura humana. La ventaja decisiva no es el ahorro: es que los datos confidenciales no viajan a ninguna parte.
1. Qué es la IA local (y qué no es)
Cuando le escribes a un asistente en la nube, tu texto viaja a un centro de datos, allí se calcula la respuesta y vuelve. Funciona muy bien y no tiene nada de malo. Pero implica tres cosas: necesitas conexión, pagas por uso o por suscripción, y tu información pasa por una máquina que no es tuya.
La IA local invierte las tres. Descargas un archivo con el modelo —los "pesos", que es donde está guardado lo que sabe—, lo abres con un programa que lo ejecuta y ya conversas con él. Sin cuenta, sin API, sin factura por consulta.
Nada sale de tu equipo
El contrato, la historia clínica o la base de clientes se procesan donde están. No hay servidor intermedio al que preguntarle después qué hizo con esos datos.
Costo por uso: cero
Una vez descargado, puedes lanzarle diez mil consultas o ninguna: cuesta lo mismo. Solo pagas el equipo, que probablemente ya tienes, y la luz.
Funciona sin internet
En una finca sin señal, en un avión o en mitad de un apagón. Suena a detalle menor hasta el día que el proveedor de turno se cae y tu trabajo se cae con él.
Y lo que no es: la IA local no es una copia gratis de los modelos de frontera. Un modelo que cabe en tu equipo es más pequeño que los que corren en centros de datos, y en tareas realmente difíciles se nota. Tampoco es "instalar y listo": hay que elegir modelo, ajustar cuánta memoria le das y entender qué le puedes pedir. Quien te diga que reemplaza a todo lo demás te está vendiendo humo.
2. Por qué ahora sí: las tres cosas que cambiaron
Hace dos años, correr algo decente en casa exigía una tarjeta gráfica de gama alta y mucha paciencia. Lo que cambió no fue una cosa, fueron tres, y encajaron casi a la vez.
Los modelos abiertos buenos se hicieron pequeños
Google publicó Gemma 4 el 2 de abril de 2026 bajo licencia Apache 2.0, con versiones que —según la propia Google— corren completamente sin conexión y con latencia casi nula en teléfonos, en una Raspberry Pi y en placas Jetson. OpenAI había hecho algo parecido con gpt-oss-20b, diseñado para funcionar dentro de 16 GB de memoria. Modelos serios, gratis y con permiso explícito de uso comercial.
La mezcla de expertos: mucho cerebro, poco esfuerzo
Es el truco que más ha movido la aguja. En vez de usar todo el modelo para cada palabra, se divide en "expertos" y se activan solo los que hacen falta. El modelo con el que hicimos las pruebas de más abajo, Qwen3.6-35B-A3B de Alibaba, tiene 35 mil millones de parámetros pero activa solo 3 mil millones en cada palabra que genera. Ocupa memoria como un modelo grande y corre como uno pequeño.
La cuantización dejó de doler
Cuantizar es guardar los números internos del modelo con menos precisión: en vez de 16 bits por parámetro, 4. El archivo se encoge a la cuarta parte y la pérdida de calidad, con las técnicas actuales, es pequeña. Nosotros comparamos las versiones de 4, 6 y 8 bits del mismo modelo en trabajo real, no mirando tablas, y nos quedamos con la de 4 bits: 20,43 GB frente a los cerca de 70 GB que pesaría ese modelo sin cuantizar, y cuesta notar la diferencia. Esa comparación lleva una tarde y es la que casi nadie hace.
¿Sabías que...?
Casi todas las empresas quieren IA privada, pero casi ninguna la está montando. En una encuesta de NTT DATA a casi 5.000 directivos de más de 30 mercados (mayo de 2026), más del 95% dijo que la IA privada y soberana es importante, pero solo el 29% la está priorizando de forma concreta. Cerca del 60% señaló las restricciones para mover datos entre países como una traba seria. La distancia entre lo que se dice y lo que se hace es, ahora mismo, una ventaja competitiva para quien la recorra primero.
3. ¿Qué IA cabe en tu equipo? Míralo aquí
La pregunta que todo el mundo hace mal es "¿qué procesador necesito?". Lo que manda es la memoria: la VRAM de tu tarjeta gráfica si tienes un PC, o la memoria unificada si tienes un Mac con chip Apple Silicon (ahí el procesador y el gráfico comparten la misma memoria, y por eso un portátil de 64 GB carga modelos que no le caben a una tarjeta gráfica potente de 24 GB).
Elige cuánta memoria tiene tu equipo y mira qué te da:
Qué puedes correr según tu memoria
En PC cuenta la VRAM de la tarjeta gráfica; en Mac con Apple Silicon, la memoria unificada. Deja siempre un margen para el sistema: un modelo de 20 GB no cabe cómodo en un equipo de exactamente 20 GB.
4. Nuestra prueba: qué medimos y qué salió
Hasta aquí, teoría. Lo que viene ahora está medido, no estimado: son pruebas que hicimos en santa marta crea a lo largo de junio y julio de 2026, con sus fechas y sus números. Estas son las condiciones, para que cualquiera pueda repetirlas:
| Pieza | Qué usamos en la prueba | Por qué |
|---|---|---|
| Equipo de prueba | Un Mac Studio con 64 GB de memoria unificada | Una configuración intermedia: el Mac Studio arranca en 36 GB y ha llegado a ofrecerse hasta 512. Ni el suelo ni el techo — equilibrio entre capacidad y precio. |
| Modelo | Qwen3.6-35B-A3B, licencia abierta, cuantizado a 4 bits (20,43 GB en disco) | Mezcla de expertos con 3 mil millones de parámetros activos: entiende imágenes, usa herramientas y vuela. Cualquiera puede descargarlo gratis. |
| Motor | LM Studio, sirviendo en 127.0.0.1 | Ganó a dos alternativas que probamos. Se carga solo cuando se necesita y se descarga a los 30 minutos sin uso. |
| Contexto | 128.000 tokens | Cabe un expediente completo en una sola conversación sin trocearlo. |
Lo que más sorprende a quien lo ve por primera vez no es la calidad: es la velocidad. Sobre ese equipo medimos 97,7 tokens por segundo el 19 de junio de 2026, con el primer carácter apareciendo a los 0,11 segundos de pulsar enviar. Así se ve escribiendo a esa velocidad:
97,7 tokens por segundo, en directo
para poner la cifra en contexto
Una persona lee cómodamente unas 250 palabras por minuto. El modelo de la prueba escribe a razón de
~4.400
palabras por minuto — unas quince veces más rápido de lo que puedes leerlas
También descartamos cosas, y eso cuenta igual. Probamos dos motores alternativos y los dos perdieron contra LM Studio en velocidad o en estabilidad. Probamos el speculative decoding, una técnica para acelerar la generación, y no la activamos: en un modelo que ya va a casi 100 tokens por segundo no aporta nada. Y decidimos no comprar un equipo más caro para correr modelos más grandes, porque la calidad que hoy exige 70 mil millones de parámetros va camino de caber en la mitad. Esperar, en este terreno, no es quedarse quieto.
El experimento que no esperábamos que saliera bien
En julio dimos un paso más: clonar una voz en local. Grabamos 27 segundos de una persona hablando —hablando de verdad, sin leer un guion— y con eso el modelo genera cualquier texto con su voz, en el mismo Mac, sin cuota de caracteres.
Luego hicimos una prueba a ciegas contra el servicio de clonación de pago más conocido del mercado: el mismo texto, la misma voz, los dos audios igualados en volumen y en orden aleatorio. Ganó el local. La palabra que usó quien escuchó fue "más estable". Eso es lo que hoy corre en un computador de escritorio y cuesta cero por minuto generado. Es la misma línea de trabajo de la que salió SonIA, nuestro asistente de voz.
"Un clon hecho sobre una lectura lee: suena aplicado y tenso. Hay que hablar, no leer."
— Conclusión de nuestras pruebas de clonación de voz, julio de 2026
5. Local o nube: cuándo conviene cada una
Aquí es donde la mayoría de los artículos te venden una guerra. No la hay: nosotros usamos las dos, y la decisión se toma por tarea, no por bando.
| IA local | IA en la nube | |
|---|---|---|
| Datos confidenciales | No salen del equipo. Punto. | Viajan a un servidor de terceros, casi siempre fuera del país |
| Costo por consulta | Cero, ilimitado | Por suscripción o por token consumido |
| Techo de calidad | Bueno y subiendo, pero por debajo de la frontera | Lo mejor que existe hoy |
| Montaje | Requiere equipo con memoria y una tarde de configuración | Abres una web y ya |
| Sin conexión | Funciona igual | No funciona |
| Volumen alto y repetitivo | Sale gratis procesar miles de documentos | La factura crece con cada documento |
La regla que seguimos es sencilla: lo confidencial y lo repetitivo, en local; lo difícil y puntual, en la nube. Un despacho que clasifica cientos de contratos al mes, una clínica que resume historias clínicas o una contadora que procesa soportes tienen un caso clarísimo para lo local. Un análisis estratégico complejo una vez al mes, no.
Y hay una capa legal que en Colombia conviene no pasar por alto. La Superintendencia de Industria y Comercio ya se pronunció —concepto del 27 de junio de 2025— recordando que usar inteligencia artificial en actividades comerciales no exime de respetar el habeas data y la Ley 1581 de 2012. Cuando el dato no sale del equipo, media conversación sobre autorizaciones y transferencias internacionales deja de existir.
6. Cómo probarla esta semana sin gastar un peso
Si tienes un equipo con 16 GB o más, puedes tener IA local funcionando en una tarde. Este es el camino corto:
Mira cuánta memoria tienes
En Mac, menú Apple → Acerca de este Mac. En Windows, Administrador de tareas → Rendimiento (fíjate en la memoria dedicada de la gráfica, no solo en la RAM). Ese número decide todo lo demás.
Instala un programa que ejecute modelos
LM Studio es el más cómodo para empezar: tiene interfaz gráfica, busca los modelos, te avisa si uno no te cabe y lo descarga por ti. Ollama es la alternativa por línea de comandos si te mueves bien en la terminal.
Empieza por un modelo pequeño
Baja primero uno de 4 mil millones de parámetros aunque tu equipo aguante más. Ver funcionar algo en cinco minutos motiva mucho más que pelearse dos horas con un modelo que no arranca. Después subes.
Dale tu trabajo real, no acertijos
Pásale un correo tuyo para que lo resuma, un texto para corregir, un pliego para extraer fechas. Ahí verás si te sirve. Y si quieres entender de verdad lo que estás usando, nuestro curso gratuito Entiende la IA parte desde cero.
Un consejo de quien ya se dio el golpe: no dejes el modelo cargado en memoria todo el día. Nosotros lo tuvimos residente y 20 GB ocupados permanentemente ahogaron el equipo hasta para tareas normales. Ahora se carga cuando se llama y se descarga a la media hora sin uso. La diferencia se nota en todo lo demás que tengas abierto.
Test de Conocimientos IA
¿Sabes qué es un token, un parámetro o la cuantización? Mide de verdad cuánto entiendes de lo que acabas de leer.
HACER TEST 02Test de Madurez Digital
Antes de montar IA local en tu empresa, mira en qué punto está tu operación. El diagnóstico toma tres minutos.
HACER TESTPreguntas Frecuentes
Haz clic en cada pregunta para ver la respuesta
01¿Qué es la IA local y en qué se diferencia de ChatGPT?
La IA local es un modelo de lenguaje que se descarga y se ejecuta dentro de tu propio equipo, sin enviar nada a internet. La diferencia con ChatGPT, Claude o Gemini no está en cómo se usa (escribes y te responde igual), sino en dónde ocurre el cálculo: en la nube, tu texto viaja a un servidor de otra empresa; en local, no sale del computador. A cambio, los modelos que caben en un equipo normal son más pequeños que los de la frontera, así que rinden algo menos en tareas muy difíciles.
02¿Qué computador necesito para correr IA local?
Lo que manda es la memoria disponible para el modelo: la VRAM de la tarjeta gráfica en un PC, o la memoria unificada en un Mac con chip Apple Silicon. Con 8 GB ya corres modelos de 2 a 4 mil millones de parámetros para tareas cortas. Con 16 GB entra un modelo de trabajo real: gpt-oss-20b de OpenAI, por ejemplo, está diseñado para funcionar dentro de 16 GB. Con 32 GB o más caben modelos de 30 mil millones de parámetros cuantizados, que ya sirven como asistente diario. El procesador importa menos que la memoria.
03¿La IA local es gratis?
Los modelos sí: Gemma 4 de Google, la familia Qwen de Alibaba y gpt-oss de OpenAI se publican bajo licencia Apache 2.0, que permite uso comercial sin pagar regalías. Los programas para ejecutarlos también son gratuitos. Lo que cuesta es el equipo que ya tienes o que compres, la electricidad y el tiempo de montarlo. No hay suscripción mensual ni cobro por consulta: una vez montado, el costo por uso es cero.
04¿Sirve la IA local para una empresa en Colombia?
Sirve especialmente donde los datos no deberían salir: historias clínicas, contratos, nóminas, bases de clientes. La Superintendencia de Industria y Comercio ya se pronunció en 2025 recordando que el uso de inteligencia artificial en actividades comerciales debe respetar el habeas data y la Ley 1581 de 2012. Procesar esa información en un equipo propio elimina de raíz la pregunta de a qué servidor y a qué país viajaron los datos. Para tareas sin datos sensibles, la nube sigue siendo más cómoda y más potente.
05¿Qué tan rápido responde un modelo local?
Más rápido de lo que la mayoría espera. En nuestra prueba del 19 de junio de 2026, sobre un Mac Studio con 64 GB de memoria unificada y el modelo Qwen3.6-35B-A3B cuantizado a 4 bits, medimos 97,7 tokens por segundo, con el primer carácter apareciendo a los 0,11 segundos de enviar la pregunta. Eso equivale a unas 4.400 palabras por minuto: alrededor de quince veces la velocidad a la que una persona lee cómodamente. La razón es la arquitectura de mezcla de expertos, que activa solo 3 mil millones de los 35 mil millones de parámetros del modelo en cada palabra que genera.
Conclusión
La IA local pasó de ser un juguete de entusiastas a una herramienta de trabajo en cuestión de meses, y no porque alguien anunciara nada espectacular: porque los modelos abiertos se volvieron pequeños, la mezcla de expertos abarató el cálculo y la cuantización dejó de doler. Todo eso a la vez, y todo gratis.
Lo interesante es que la tendencia sigue en la misma dirección. La calidad que hoy exige un modelo enorme irá bajando al rango que cabe en un equipo normal, sin que tengas que comprar nada nuevo. Por eso nuestra decisión fue plantar bandera en un equipo equilibrado y dejar que el progreso trabaje.
Si en tu empresa hay información que preferirías que no viajara a ningún servidor —y casi siempre la hay—, este es el momento de mirarlo en serio. No hace falta un centro de datos: hace falta saber qué tarea poner en local, cuál dejar en la nube y con qué equipo. Ese trabajo de decidir es justo lo que acompañamos en nuestros planes para empresa.
¿Tienes datos que no deberían viajar?
Media hora, sin compromiso y sin presentación de ventas: miramos qué equipo tienes, qué tareas repites cada semana y cuáles tiene sentido mover a un modelo local. Si no lo tiene, te lo decimos igual.
Agendar consultoría gratuita