top of page

Gemma 4 12B: probando la IA local de Google en PC y Android

  • 17 jun
  • 17 min de lectura

la IA local empieza a ponerse seria

Durante los últimos años nos hemos acostumbrado a usar la inteligencia artificial como un servicio en la nube. Abrimos ChatGPT, Gemini, Claude o cualquier otra herramienta similar, escribimos una pregunta y recibimos una respuesta generada en servidores remotos, pero cada vez empieza a tener más sentido otra forma de trabajar: ejecutar modelos de IA directamente en nuestro propio equipo.


Esto cambia bastante las reglas del juego. Si el modelo funciona en local, los datos no tienen por qué salir del dispositivo, el coste no depende de cada llamada a una API y podemos trabajar incluso sin conexión. Además, ganamos más control sobre el modelo, la configuración y la forma de integrarlo en nuestro flujo de trabajo.


En este contexto aparece Gemma 4 12B, un modelo de Google especialmente interesante porque intenta colocarse en un punto muy atractivo: ser suficientemente potente para resultar útil, pero suficientemente contenido para poder ejecutarse en equipos locales razonables.


En este artículo vamos a hablar de la IA en local, con sus ventajas e inconvenientes. Después presentaremos Gemma 4 12B y veremos qué aporta. Por último, mostraremos una prueba sencilla en tres escenarios: un PC con GPU dedicada, un PC sin GPU dedicada pero con bastante RAM, y un móvil Android usando Google AI Edge Gallery.


La pregunta de fondo no es si la IA local va a sustituir mañana a los grandes modelos en la nube. La pregunta es otra: ¿Qué parte de nuestro trabajo empieza a tener sentido ejecutar directamente en nuestro propio dispositivo?


Anuncio de Gemma 4 12B con laptop y móvil en fondo azul neón, mostrando IA en local y textos de privacidad y control.
la IA local empieza a ponerse seria

El auge de la IA en local

Cuando hablamos de IA en local nos referimos a ejecutar un modelo directamente en nuestro propio dispositivo: un portátil, un PC de sobremesa, una estación de trabajo, un pequeño servidor o incluso un móvil.


La diferencia es importante. En un servicio en la nube, escribimos una petición y esa información viaja a servidores externos. En un modelo local, la inferencia ocurre dentro de nuestro equipo. El modelo está descargado, los datos se procesan cerca de nosotros y el control técnico pasa en gran parte al usuario.


Este enfoque no es nuevo, pero durante mucho tiempo ha sido poco práctico. Los modelos eran demasiado grandes, el hardware necesario era caro y las herramientas no estaban pensadas para usuarios normales. Instalar un modelo local podía convertirse en una pequeña aventura técnica.


Red de servidores y dispositivos con pantallas LOCAL AI en un entorno azul futurista, conectados por líneas de datos.
La IA local

Ahora la situación empieza a cambiar.

Por un lado, los modelos pequeños y medianos han mejorado mucho. Por otro, la cuantización permite reducir el tamaño de los modelos para que ocupen menos memoria. Y además han aparecido herramientas como LM Studio, Ollama, llama.cpp o Google AI Edge Gallery, que hacen que probar IA local sea mucho más sencillo que hace unos años.


Las ventajas son claras. La privacidad mejora, porque no tenemos que enviar documentos, código o información sensible a un servidor externo. El coste también cambia: una vez tenemos el modelo funcionando, no pagamos por cada token generado. Además, podemos trabajar sin conexión y adaptar mejor el modelo a nuestro flujo de trabajo.


Pero tampoco conviene idealizarlo.

La IA local necesita hardware. Consume RAM, VRAM, CPU, GPU y batería. La velocidad puede variar muchísimo de un equipo a otro. Y, en muchos casos, los grandes modelos en la nube seguirán siendo más potentes, más actualizados y más cómodos para tareas complejas.


Por eso la comparación correcta no es “local contra nube”. La comparación interesante es otra: qué tareas tiene sentido hacer en local y cuáles siguen teniendo más sentido en la nube.


Ahí es donde modelos como Gemma 4 12B empiezan a llamar la atención. Porque no prometen sustituir todo lo que hacemos con IA, pero sí abren una puerta muy interesante: llevar parte de esa inteligencia directamente a nuestro propio equipo.


Ventajas de la IA local

Inconvenientes de la IA local

Mayor privacidad: los datos pueden quedarse en nuestro equipo.

Necesita hardware suficiente para funcionar bien.

Coste de uso más predecible: no se paga por cada llamada a una API.

La velocidad depende mucho del dispositivo.

Puede funcionar sin conexión a internet.

Los modelos cloud suelen ser más potentes.

Más control sobre modelo, versión y configuración.

La instalación puede requerir cierta curva de aprendizaje.

Útil para documentos, código o información sensible.

Consume RAM, VRAM, CPU, GPU y batería.

Facilita integraciones locales y automatizaciones propias.

No todas las herramientas soportan todas las capacidades del modelo.


Qué es Gemma 4 12B

Gemma 4 12B es un modelo de inteligencia artificial desarrollado por Google DeepMind dentro de la familia Gemma. Su objetivo es colocarse en un punto bastante interesante: ser más capaz que los modelos pequeños pensados para dispositivos muy limitados, pero sin llegar al tamaño de los grandes modelos que necesitan hardware mucho más exigente.


Dicho de forma sencilla: Gemma 4 12B intenta ser un modelo potente, pero todavía razonablemente manejable para trabajar en local.


Tiene aproximadamente 12.000 millones de parámetros, una ventana de contexto muy amplia de 256K tokens y capacidades multimodales. Esto significa que puede trabajar con texto, imagen y audio como entrada, aunque su salida sigue siendo texto.


Uno de los puntos importantes es su licencia. No conviene decir simplemente que es “open source”, porque en modelos de IA esa expresión puede ser algo imprecisa. Es más correcto decir que Gemma 4 12B se publica como un modelo de pesos abiertos bajo licencia Apache 2.0, lo que permite un uso bastante flexible, también en escenarios comerciales.


Su interés no está solo en la ficha técnica. Lo interesante es el equilibrio que propone: contexto largo, multimodalidad, tamaño medio y posibilidad de ejecución local. No pretende sustituir en todos los casos a los modelos cloud más potentes, pero sí puede cubrir muchas tareas prácticas sin necesidad de enviar datos a servidores externos.

A modo de resumen, esta sería su ficha básica:

Característica

Gemma 4 12B

Desarrollador

Google DeepMind

Fecha de lanzamiento

3 de junio de 2026

Familia

Gemma

Tipo de modelo

Denso

Parámetros

Aproximadamente 11,95B (11,95 mil millones)

Capas

48

Ventana de contexto

256K tokens

Entrada

Texto, imagen y audio

Vídeo

Comprensión mediante secuencias de frames

Salida

Texto

Licencia

Pesos abiertos bajo Apache 2.0

Idiomas

Pre-entrenado en 140+ idiomas y soporte listo en 35+

Memoria estimada

26,7 GB en BF16, 13,4 GB en 8-bit y 6,7 GB en Q4_0

El último punto es importante. Que el modelo pueda cargarse en versiones cuantizadas no significa que cualquier equipo vaya a ofrecer la misma experiencia. La memoria necesaria depende también del contexto usado, del programa con el que lo ejecutemos y del tipo de tarea.

Por eso Gemma 4 12B no debe verse solo como “un modelo que cabe en local”, sino como una pieza más dentro de un ecosistema: modelo, cuantización, hardware y software trabajando juntos.


La parte técnica explicada sin complicarla demasiado

Uno de los aspectos más interesantes de Gemma 4 12B está en cómo entiende la multimodalidad. Cuando hablamos de un modelo multimodal nos referimos a un modelo capaz de trabajar con más de un tipo de entrada. No solo texto, sino también imágenes, audio o incluso vídeo entendido como una secuencia de imágenes.


Tradicionalmente, muchos modelos multimodales han funcionado como una especie de sistema por piezas. Una parte se encarga de interpretar la imagen, otra parte puede encargarse del audio y, finalmente, todo eso se transforma en una representación que el modelo de lenguaje puede entender.

Ese enfoque funciona, pero tiene un coste. Cada pieza adicional puede aumentar la memoria necesaria, la latencia y la complejidad del sistema. Y cuando queremos ejecutar IA en local, cada gigabyte de memoria y cada segundo de espera importan.


La propuesta de Gemma 4 12B va en una dirección más integrada. Según la documentación analizada, el modelo utiliza una arquitectura basada en un único transformer decoder-only. Para visión, sustituye el encoder visual de otros modelos por un componente más ligero que proyecta la información visual hacia el espacio interno del modelo. En audio, también evita un encoder dedicado y proyecta la señal directamente al espacio del modelo.


Dicho de forma sencilla: en lugar de montar un sistema multimodal con varias piezas pesadas alrededor, Gemma 4 12B intenta acercar texto, imagen y audio al mismo núcleo de razonamiento del modelo.


Esto no significa que sea magia, ni que desaparezcan los límites. La salida del modelo sigue siendo texto. No genera imágenes, no genera audio y no genera vídeo. Además, que el modelo tenga una capacidad no quiere decir que todas las herramientas la soporten igual desde el primer día.


Pero sí es una idea importante para la IA local. Si queremos llevar modelos multimodales a portátiles, equipos de oficina o móviles, no basta con que sean inteligentes. También tienen que ser razonablemente eficientes.

Y ahí es donde esta arquitectura tiene sentido: no solo busca mejorar lo que el modelo puede hacer, sino facilitar que pueda hacerlo más cerca del usuario.


Portátil futurista con holograma de IA azul; fluyen textos, paisaje, audio y video hacia el sistema en ambiente tecnológico.
Modelo multimodal

Qué podemos hacer con Gemma 4 12B en local

La parte interesante de un modelo local no es solo conseguir que arranque en nuestro equipo. Lo importante es que sirva para algo. En el caso de Gemma 4 12B, su combinación de texto, contexto largo y capacidades multimodales abre varios usos prácticos.


El primero es el trabajo con documentos. Poder resumir textos, analizar notas, extraer información o revisar documentación interna sin subir esos archivos a la nube puede ser muy útil, especialmente cuando hablamos de información sensible o de trabajo.


También puede ser interesante como asistente de programación local. Un modelo con una ventana de contexto amplia puede ayudarnos a revisar fragmentos de código, explicar funciones, generar scripts o trabajar sobre varios archivos de un proyecto. No sustituye a un desarrollador, pero puede actuar como apoyo constante sin coste por token y sin enviar el código a servidores externos.


Otro campo evidente es el uso multimodal. Si la herramienta que usamos lo permite, Gemma 4 12B puede trabajar con imágenes, capturas de pantalla, documentos visuales o audio. Esto abre la puerta a casos como interpretar una captura, analizar una imagen técnica, revisar un documento escaneado o transformar instrucciones habladas en texto útil.


Además, este tipo de modelos empiezan a tener sentido dentro de flujos de automatización local. Por ejemplo, como motor para clasificar documentos, preparar borradores, generar respuestas, revisar contenido o ayudar en tareas repetitivas. Eso sí, conviene separar bien dos cosas: lo que el modelo puede razonar y lo que el sistema donde lo ejecutamos le permite hacer. Un modelo puede proponer un script, una acción o una respuesta, pero necesita una aplicación anfitriona que valide, ejecute o conecte esa salida con otras herramientas. Por eso Gemma 4 12B no debe verse solo como un chat local. Puede ser una pieza dentro de un sistema más amplio: documentos, código, voz, imágenes, automatizaciones y privacidad trabajando en el mismo entorno.


Uso principal

Qué permite hacer

Ejemplo práctico

Trabajo con documentos

Resumir, analizar y extraer información de textos largos.

Revisar un informe interno sin subirlo a la nube.

Asistente de programación

Explicar código, generar scripts y revisar fragmentos.

Pedirle ayuda para entender una función o crear un script en Python.

Análisis de imágenes

Interpretar capturas, esquemas, gráficos o documentos visuales.

Analizar una captura de pantalla o una imagen técnica.

Entrada de audio

Trabajar con instrucciones habladas, si la herramienta lo permite.

Dictar una orden para transformar unas notas en un texto estructurado.

Automatización local

Integrarse en flujos internos de trabajo.

Clasificar documentos, preparar borradores o generar respuestas.

Trabajo offline

Usar IA sin depender de conexión a internet.

Seguir trabajando durante un viaje o en entornos con conexión limitada.

Privacidad empresarial

Procesar datos sensibles dentro del propio equipo.

Revisar documentación financiera, técnica o legal sin enviarla a servidores externos.

Prototipado con IA

Crear pruebas rápidas sin coste por token.

Montar un pequeño asistente local para experimentar con documentos o código.

Nuestra prueba práctica: tres escenarios reales

Una cosa es leer la ficha técnica de un modelo y otra muy distinta es instalarlo y comprobar cómo se comporta en un equipo real.

Por eso, en este artículo no queríamos quedarnos solo en la teoría. Hemos querido probar Gemma 4 12B en tres escenarios bastante diferentes: un PC con GPU dedicada, un PC sin GPU dedicada pero con bastante memoria RAM, y un móvil Android usando Google AI Edge Gallery.


El objetivo no es hacer un benchmark científico. Para eso harían falta equipos equivalentes, muchas repeticiones, mediciones controladas y una metodología mucho más estricta. Nuestra prueba es más sencilla y más práctica: ver si el modelo arranca, cómo se instala, qué sensación de uso deja y qué limitaciones aparecen durante una primera toma de contacto.


En cada caso mostraremos la herramienta utilizada, algún pantallazo del proceso o del resultado, y algunos comentarios sobre la experiencia. Nos interesa especialmente la parte práctica: si parece usable, si resulta demasiado lento, si la instalación es sencilla o si el escenario tiene sentido para un usuario normal.

Los tres escenarios elegidos son:

Escenario

Herramienta

Qué queremos comprobar

PC con GPU dedicada

LM Studio

Si Gemma 4 12B puede ofrecer una experiencia local fluida con ayuda de una gráfica.

PC sin GPU dedicada

LM Studio

Si el modelo puede funcionar solo con CPU y RAM, aunque sea de forma más pausada.

Móvil Android

Google AI Edge Gallery

Si la IA local en móvil empieza a ser una opción real para tareas sencillas.

Más que buscar una puntuación final, queremos usar estas pruebas como punto de partida. La experiencia con IA local depende mucho del hardware, del modelo descargado, de la cuantización, del programa utilizado y de las expectativas de cada usuario.


Por eso, la mejor conclusión no será “este modelo da exactamente estos resultados”, sino algo más útil: en qué tipo de equipo tiene sentido probarlo y qué puede esperar alguien que quiera empezar con IA local.


Escenario 1: Gemma 4 12B en un PC con GPU dedicada

El primer escenario de prueba es probablemente el más favorable para trabajar con Gemma 4 12B en local: un PC con GPU dedicada. En este caso utilizamos LM Studio, una de las herramientas más cómodas para descargar, cargar y probar modelos locales sin tener que pelearse demasiado con la terminal.


Si quieres saber más sobre el funcionamiento de LM Studio, puedes consultar este artículo que escribimos hace tiempo, dentro de una serie que hicimos sobre uso de LLMs en local: "LLMs en Local (I): LM Studio"


Volviendo a nuestro experimento, la idea era sencilla: buscar una versión cuantizada de Gemma 4 12B, cargarla en el equipo y comprobar si la experiencia era suficientemente fluida para un uso normal.


En un equipo portátil con una GPU RTX4070 de 8 GB de VRAM, no tiene sentido intentar cargar el modelo en su versión completa de mayor precisión. Para este tipo de hardware, lo razonable es usar una versión cuantizada, por ejemplo en formato GGUF, que reduce mucho el tamaño del modelo y permite ejecutarlo en equipos más modestos. En nuestro caso hemos cargado el modelo cuantizado Q4 que ocupa 7,6Gb (en lugar de los algo más de 16Gb que ocupa el modelo no cuantizado)


Interfaz oscura de IA con PDF cargado, consulta en español y resultado de análisis; se ve google/gemma-4-12b y métricas.
IA Local en PC con GPU - Leyendo un PDF

Para probar, le hemos subido el paper de "Attention is all you need", que es la base de los Transformers, y le hemos pedido que nos saque la información mas relevante de dicho documento. Nos dio una respuesta bastante buena, con referencias al propio documento. A partir de ahí seguimos interactuando y pidiendo un esquema, una tabla, e incluso que nos ayudara a generar un artículo para una publicación sobre este paper. En este caso nos ha indicado una velocidad de 12,23 tokens por segundo.



Captura de pantalla de una interfaz LLM con aviso en árabe y botón de alerta; fondo oscuro y métricas de modelo.
IA Local en PC con GPU - Analizando Imagen

Otra prueba que hicimos, para probar esa "multimodalidad" que tiene, es darle una imagen de un texto en árabe para que nos explicara que quería decir ese texto. La respuesta ha sido correcta, y la velocidad que ha indicado ha sido de 14,62 tokens por segundo.


El modelo responde con una fluidez "razonable". Para tareas como redactar borradores, resumir textos, pedir explicaciones técnicas o generar pequeños fragmentos de código, la experiencia resulta usable, así que la conclusión de esta primera prueba sería: si tenemos una GPU dedicada, la IA local empieza a ser una herramienta que realmente se puede usar y proporciona una experiencia bastante razonable.


Escenario 2: Gemma 4 12B en un PC sin GPU dedicada

El segundo escenario es quizá el más interesante para muchos usuarios de oficina: un PC sin GPU dedicada, pero con una cantidad razonable de memoria RAM.


En esta prueba utilizamos de nuevo LM Studio, pero esta vez ejecutando el modelo sin apoyo de una tarjeta gráfica. La idea era comprobar si Gemma 4 12B podía funcionar únicamente con CPU y RAM, aunque fuese con una experiencia más pausada.


Para mantener la prueba dentro de unos límites razonables, lo lógico es utilizar también una versión cuantizada del modelo. Aunque el equipo tenga suficiente RAM. 32GB en este caso, cargar versiones más pesadas puede hacer que la experiencia sea demasiado lenta o poco práctica. En IA local no se trata solo de que el modelo arranque, sino de que se pueda usar, así que hemos usado el mismo modelo cuantizado que en la prueba anterior: modelo cuantizado Q4 que ocupa 7,6Gb


Al igual que en la prueba anterior, le hemos subido el paper de "Attention is all you need". La respuesta que nos devolvió fue buena, pero el tiempo de respuesta fue bastante más largo. En este caso nos ha indicado una velocidad de 3,16 tokens por segundo.


Interfaz oscura de IA analizando el PDF Paper_AttentionsAllYouNeed.pdf; aparece texto en español, modelo gemma-4-12b-it y métricas.
IA Local en PC sin GPU - Leyendo un PDF

Como siguiente prueba le pasamos la misma imagen que en el otro escenario. La respuesta ha sido correcta, y la velocidad que ha indicado ha sido de 3,16 tokens por segundo, mucho menor que la que conseguimos con el PC con GPU.


La diferencia frente al PC con GPU se nota. El modelo responde, pero el ritmo es más lento. La generación de texto se percibe de forma más pausada y la conversación no tiene la misma fluidez que en el escenario anterior.

Aun así, la prueba no deja una sensación negativa. Para tareas donde no necesitamos una respuesta inmediata, el modelo puede seguir teniendo utilidad. Por ejemplo, resumir un texto, preparar un borrador, analizar unas notas o generar una primera versión de un documento son usos donde podemos esperar unos segundos más sin que el flujo de trabajo se rompa demasiado.


La conclusión de esta segunda prueba es que Gemma 4 12B puede funcionar en un PC sin GPU dedicada, pero hay que ajustar expectativas. No es el escenario ideal para mantener una conversación rápida ni para tareas muy largas, pero sí puede servir como punto de entrada para quien quiera experimentar con IA local sin comprar hardware específico.


En este caso, la clave está en entender el tipo de uso. Con CPU y RAM, la IA local no se siente como un copiloto instantáneo, sino más bien como una herramienta de apoyo que trabaja a otro ritmo.

Y eso, para ciertos usos, puede ser suficiente.


Escenario 3: Gemma 4 12B en un móvil Android

El tercer escenario es el más diferente de todos: ejecutar IA local directamente en un teléfono móvil Android.

Para esta prueba utilizamos Google AI Edge Gallery, una aplicación pensada para probar modelos de IA en dispositivos locales.


Sobre esta aplicación puedes encontrar más información en un artículo que escribimos hace tiempo dentro de nuestra serie de LLMs en local: "LLMs en Local (VI): Google AI Edge Gallery – IA generativa local en tu móvil"


La idea en esta prueba era comprobar si un móvil puede empezar a ser algo más que una simple pantalla para acceder a modelos en la nube. Aquí el enfoque cambia respecto al PC. En el móvil no estamos descargando el mismo archivo GGUF que usaríamos en LM Studio. Lo normal es trabajar con versiones optimizadas para ejecución en dispositivo, preparadas para funcionar con runtimes móviles como LiteRT o tecnologías similares.


Al abrir la aplicación "Edge Gallery" en el móvil, ya nos indica que modelos podemos descargar, y cual es recomendable para nuestro móvil. En nuestro caso descargamos el modelo "Gemma 4 E2B" de un tamaño de 2,6Gb


Collage de pantallas oscuras de Google AI Edge Gallery con AI Chat y Agent Skills, y modelos Gemma 4 con botones Descargar y Try it
APP Google Au Edge Gallery

Primero a través del AI chat le pedimos que nos explicara la diferencia entre un Qbit y un Bit. La velocidad de respuesta fue bastante rápida, y la respuesta aceptable.


Posteriormente, usando la parte de "Agent skills" le indicamos que el lunes teníamos una reunión con un cliente a las 11 de la mañana, y el propio programa a través de sus "skills", abrió la agenda y programó esa reunión que le habíamos indicado.


como última prueba, le pasamos la imagen del texto en árabe, al igual que habíamos hecho en los escenarios anteriores, y analizó la imagen bastante rápido y nos dio la respuesta correcta.


Collage de pantallas de una app de IA: Ask Image, chat, traducción al español y explicación de bit y qubit en fondo oscuro.
Gemma 4 funcionando en un móvil

La sensación general es que la IA local en móvil empieza a ser viable para tareas sencillas: consultas cortas, pequeñas reformulaciones, pruebas rápidas o asistentes básicos. Es verdad que usamos un modelo mucho más pequeño, pero la fluidez en la conversación fue bastante buena. Gemma 4 en Android no es solo una curiosidad. Es una pista de hacia dónde puede evolucionar la IA integrada directamente en nuestros dispositivos.


Comparativa sencilla de la experiencia

Después de probar Gemma 4 en tres escenarios distintos, la conclusión más evidente es que la experiencia cambia mucho según el dispositivo y según el modelo que realmente podemos ejecutar en cada caso.


En los dos PCs hemos utilizado el mismo modelo cuantizado en formato Q4, de unos 7,6 GB. Esto nos permite comparar de forma bastante directa la diferencia entre ejecutarlo con una GPU dedicada y ejecutarlo únicamente con CPU y RAM.

En el móvil Android, en cambio, el escenario es distinto. No hemos usado el mismo archivo GGUF ni el modelo 12B, sino Gemma 4 E2B, recomendado por Google AI Edge Gallery para nuestro dispositivo, con un tamaño aproximado de 2,6 GB. Por tanto, la prueba móvil no debe entenderse como una comparación directa de rendimiento, sino como una demostración de hacia dónde puede ir la IA local en dispositivos móviles.

Escenario

Herramienta

Modelo probado

Experiencia general

Velocidad observada

Principal conclusión

PC con GPU dedicada

LM Studio

Gemma 4 12B Q4, 7,6 GB

Fluida y usable para trabajo real.

12,23 tokens/s en PDF y 14,62 tokens/s en imagen.

Con GPU dedicada, la IA local empieza a ser una herramienta práctica.

PC sin GPU dedicada

LM Studio

Gemma 4 12B Q4, 7,6 GB

Funciona, pero con bastante más paciencia.

3,16 tokens/s en las pruebas realizadas.

Es viable, pero no se siente como un copiloto instantáneo.

Móvil Android

Google AI Edge Gallery

Gemma 4 E2B, 2,6 GB

Sorprendentemente ágil para tareas sencillas.

Fluidez percibida buena.

No es una comparación directa con el 12B, pero muestra el potencial de la IA local en móvil.

La diferencia entre el PC con GPU y el PC sin GPU es clara. En ambos casos el modelo respondió correctamente a las pruebas planteadas, incluyendo el análisis del paper Attention is All You Need y la interpretación de una imagen con texto en árabe. Sin embargo, la velocidad cambia completamente la sensación de uso.


  • Con GPU dedicada, la experiencia resulta bastante cómoda. El modelo responde con una fluidez razonable y puede utilizarse para tareas como resumir documentos, generar borradores, analizar imágenes, pedir explicaciones técnicas o trabajar sobre ideas para un artículo.

  • Sin GPU dedicada, el modelo también funciona, pero a otro ritmo. La respuesta sigue siendo útil, pero la generación es más lenta. En este escenario tiene más sentido usarlo para tareas donde podemos esperar: resumir un texto, preparar una primera versión de un documento, analizar notas o hacer pruebas sin depender de una API externa.


El caso del móvil Android merece una lectura diferente. La prueba con Gemma 4 E2B en Google AI Edge Gallery ha sido muy interesante. El modelo respondió bien a preguntas sencillas, analizó correctamente una imagen con texto en árabe y, mediante las “Agent skills”, incluso llegó a abrir la agenda y programar una reunión. Esto no convierte al móvil en el mejor entorno para trabajar con documentos largos o tareas complejas, pero sí demuestra algo importante: la IA local en móvil empieza a ser algo más que una curiosidad.


En resumen, estas pruebas no buscan establecer un ranking definitivo. Lo que muestran es más sencillo: la IA local ya puede ser útil, pero la experiencia depende muchísimo del dispositivo, del modelo, de la cuantización y de la herramienta utilizada.


Gemma 4 12B frente a los modelos cloud

Después de probar Gemma 4 en local, es fácil caer en la tentación de plantearlo como una competición directa contra los grandes modelos en la nube. Pero seguramente ese no sea el enfoque más útil. La pregunta no debería ser si Gemma 4 12B puede sustituir a ChatGPT, Gemini, Claude u otros modelos cloud en todos los escenarios. La pregunta interesante es otra: qué tareas tiene sentido ejecutar en local y cuáles siguen teniendo más sentido en la nube.


Un modelo local como Gemma 4 12B puede ser muy interesante cuando trabajamos con información privada, documentos internos, código propio o tareas donde no queremos depender de una API externa. También tiene sentido para experimentar, crear prototipos, automatizar procesos sencillos o trabajar sin conexión. Además, una vez descargado y configurado, el coste de uso es mucho más predecible. No estamos pagando por cada consulta ni por cada token generado. Esto puede ser especialmente atractivo para usuarios que hacen muchas pruebas o para pequeñas herramientas internas donde no hace falta usar siempre el modelo más potente del mercado.


Pero los modelos cloud siguen teniendo ventajas claras. Normalmente ofrecen más capacidad, mejor razonamiento en tareas complejas, más velocidad en muchos casos, mejor integración con servicios externos y acceso más cómodo desde cualquier dispositivo. También suelen estar mejor preparados para tareas críticas donde necesitamos la máxima calidad posible.


Por eso, la conclusión más razonable no es elegir entre local o nube, sino combinar ambos mundos. Podemos usar modelos locales para tareas privadas, repetitivas, offline o de bajo coste. Y reservar los modelos cloud para tareas más exigentes, razonamiento avanzado, información actualizada o situaciones donde necesitemos la mejor respuesta posible.


La IA local nos da más control. La IA cloud nos da más potencia. Y probablemente el futuro no esté en elegir una sola, sino en aprender cuándo utilizar cada una. Por eso, la pregunta ya no es si algún día podremos usar IA en local, la pregunta ahora es mucho más interesante: ¿Qué parte de nuestro trabajo queremos mantener cerca de nosotros?


Comentarios


© 2025 by Lozkorp                                                         

bottom of page