Revolución IA

Un agente de IA que corre sin internet y sin costo por token

Un agente de IA que corre sin internet y sin costo por token
Geek
  • Publicadoseptiembre 25, 2026

Google publicó soporte para modelos locales en su SDK de Antigravity, y la cifra que lo resume es esta: en la demostración oficial, el 97,2% del trabajo se ejecutó en la máquina del usuario y solo el 2,8% pasó por la nube. Un agente de IA local completo, sin internet y sin costo por token.

Cómo funciona un agente de IA local

El arreglo es más interesante que la idea de «todo local». Es un reparto: un modelo en la nube hace la planeación, que es barata en tokens, y un modelo en tu computador ejecuta, que es lo caro.

En la demostración que publicó Google, el arquitecto en la nube —Gemini 3.8 Flash— consumió 95 tokens de planeación, mientras el modelo local ejecutó 3.322. De ahí sale el reparto de 97,2% contra 2,8%. La tarea no era de juguete: el agente auditó y parchó tres módulos de Python con vulnerabilidades.

El modelo local es Gemma 4 26B A4B, corriendo sobre el runtime LiteRT. Y hay una puerta abierta importante: el SDK acepta cualquier servidor compatible con la API de OpenAI, lo que incluye Ollama, LM Studio y vLLM. Es decir, no estás obligado a usar el modelo de Google.

El requisito de hardware es el filtro real: más de 24 GB de memoria de video o memoria unificada. Eso deja fuera un portátil corriente y deja dentro un equipo de escritorio con tarjeta gráfica decente o un Mac con memoria unificada amplia.

Por qué un agente de IA local reparte el trabajo así

La conversación sobre modelos locales suele quedarse en si igualan a los de frontera. No los igualan, y no hace falta que lo hagan.

Lo que este diseño reconoce es que las dos tareas son distintas. Decidir qué hacer requiere criterio y pocos tokens. Hacerlo —leer archivos, escribir código, revisar resultados— requiere volumen y poco criterio. Poner cada cosa donde cuesta menos es una decisión de ingeniería, no una declaración ideológica sobre la privacidad.

Qué significa para América Latina

El costo por token deja de ser el freno. Para un equipo pequeño en Bogotá o en Medellín, la razón por la que los agentes de código se quedan en piloto casi siempre es la factura en dólares. Un agente que ejecuta localmente cambia esa ecuación: se paga hardware una vez, en pesos, y no un consumo mensual variable.

Y resuelve el problema de conectividad, que es real. En buena parte de la región la conexión no es estable todo el día. Un agente que solo necesita internet para el 3% de su trabajo sigue funcionando cuando la fibra se cae, y eso vale más de lo que suena en una oficina en una ciudad intermedia.

Además, resuelve una conversación jurídica. Muchos proyectos de IA en empresas de la región mueren en el área legal porque implican mandar código o datos de clientes a un servidor ajeno. Con ejecución local, el código no sale de la máquina. Eso convierte una discusión de meses en una decisión técnica.

Ahora bien, los 24 GB no son gratis. Una tarjeta con esa memoria cuesta varios millones de pesos, y un Mac con memoria unificada suficiente también. El cálculo honesto es comparar ese gasto de una vez contra lo que hoy pagas al mes por API. Si gastas poco, no compensa; si tienes tres desarrolladores consumiendo agentes todo el día, la cuenta cambia rápido.

Un agente de IA local no es para todos: qué mirar

Es un SDK para desarrolladores, no un producto para usuarios finales. Montar esto implica instalar un runtime, bajar pesos de un modelo de 26.000 millones de parámetros y configurar el reparto. No es hacer clic en un botón.

Tampoco conviene esperar la calidad de un modelo de frontera en las tareas que exigen razonamiento largo. El diseño funciona porque le da al modelo local el trabajo mecánico, y ahí un modelo mediano rinde bien.

El movimiento de fondo sí es grande. Durante dos años la única manera de usar un agente capaz fue alquilarlo por token a tres compañías. Que el mismo flujo corra en un computador de escritorio, con pesos abiertos y un modelo intercambiable, cambia quién controla el costo. Para una región que paga en dólares lo que factura en pesos, eso no es un detalle técnico.

Sitio oficial:
Anuncio de Google para desarrolladores
Reportado por: AlphaSignal — Techgenyz

Lee también:
Atria Dawn: Shanghái libera gratis un agente de 753.000 millones de parámetros
Los límites de uso de la IA empezaron a bajar

Comparte en:
Geek
Escrito por
Redacción geeklab

Redacción geeklab es el equipo editorial del medio. Cubrimos inteligencia artificial a diario —modelos, herramientas, inversión y regulación— con una pregunta fija encima: qué significa cada hecho para quien vive y trabaja en América Latina. Verificamos cada cifra, fecha y cita contra la fuente primaria antes de publicar: el anuncio oficial, el paper, el documento judicial o la página de precios de la compañía. Cuando un dato no se puede confirmar, lo decimos en la nota. Enlazamos al sitio oficial de la herramienta o empresa de la que hablamos, no a otros portales de noticias. Usamos herramientas de inteligencia artificial para investigar y redactar borradores, siempre con revisión humana antes de publicar. Las notas con enlaces de afiliado lo declaran de forma visible.