Gemma 4: o que é o modelo de IA aberto do Google e como baixar de graça · Blog Etek

Gemma 4: o que é o modelo de IA aberto do Google e como baixar de graça

O que muda no Gemma 4, qual dos cinco tamanhos cabe no seu computador e o passo a passo para rodar o modelo offline com o LM Studio.

Arte oficial do Google para o lançamento do Gemma 4, com o nome em azul sobre fundo preto e linhas pontilhadas formando uma estrela

Em abril de 2026 o Google lançou o Gemma 4, a nova geração dos seus modelos de inteligência artificial abertos. "Aberto" aqui tem um significado bem prático: você baixa o modelo, instala no seu computador e usa sem internet, sem assinatura e sem mandar seus dados para servidor nenhum.

Neste artigo você vai entender o que é o Gemma 4, no que ele é diferente do Gemini, qual versão cabe na sua máquina e o passo a passo para baixar e rodar em poucos minutos.

1. O que é o Gemma 4

Gemma é a família de modelos abertos do Google DeepMind, o mesmo time que desenvolve o Gemini. A diferença entre os dois está em onde o modelo roda.

O Gemini roda nos servidores do Google. Você acessa pelo aplicativo, pelo site ou pela API, e tudo o que você digita vai para a nuvem do Google antes de voltar como resposta.

O Gemma você baixa. O arquivo com os "pesos" do modelo (o resultado do treinamento) fica no seu computador ou no seu celular, e a resposta é calculada ali mesmo. Dá para usar no avião, numa rede corporativa fechada ou com documentos que não podem sair da empresa.

Segundo o Google, o Gemma 4 foi construído com a mesma pesquisa e tecnologia do Gemini 3. Ele é distribuído sob a licença Apache 2.0, que permite uso comercial, modificação e redistribuição. Na prática, uma empresa pode pegar o modelo, treinar com os próprios dados e colocar num produto sem pagar licença ao Google.

Gráfico do Google comparando a pontuação Elo dos modelos abertos com o tamanho de cada um; o Gemma 4 31B e o 26B aparecem destacados no canto superior esquerdo
Desempenho por tamanho no ranking Arena AI em abril de 2026. Os dois pontos azuis são os Gemma 4. Fonte: Google.

O gráfico acima é do próprio Google, então leia com a desconfiança de sempre. Mas o ponto que ele defende é interessante: no ranking Arena AI, a versão de 31 bilhões de parâmetros ficou em terceiro lugar entre os modelos abertos do mundo, à frente de modelos até vinte vezes maiores. Para quem vai rodar o modelo num notebook, tamanho é tudo.

O que o Gemma 4 faz

  • Raciocínio. Todos os tamanhos têm um modo de "pensar" antes de responder, que ajuda em matemática, lógica e problemas de várias etapas.
  • Agentes. Suporte nativo a chamada de função e saída em JSON, que é o que permite ao modelo usar ferramentas e executar fluxos de trabalho, como consultar uma planilha ou chamar uma API.
  • Código. Geração e correção de código sem internet. O Google vende isso como um assistente de programação local.
  • Imagem e vídeo. Todos os modelos leem imagens e vídeos. Isso inclui OCR, leitura de PDF, entendimento de gráficos e de telas.
  • Áudio. As versões menores (E2B, E4B e 12B) aceitam áudio como entrada, para transcrição e tradução de fala.
  • Contexto longo. 128 mil tokens nos modelos pequenos e 256 mil nos maiores, o suficiente para um livro ou um repositório de código num único prompt.
  • Português. Treinado em mais de 140 idiomas, português entre eles.

2. Os cinco tamanhos

Aqui está a parte que importa para quem vai instalar. O Gemma 4 vem em cinco tamanhos, e a escolha depende da memória do seu computador.

VersãoPara que serveDownload (LM Studio)Memória recomendada
E2BCelular, Raspberry Pi, computador fraco4,2 GB8 GB de RAM
E4BCelular topo de linha e notebook comum5,9 GB8 GB de RAM
12BNotebook com 16 GB7,4 GB16 GB de RAM
26B (A4B)Computador com placa de vídeo15,6 GB32 GB de RAM ou GPU de 24 GB
31BEstação de trabalho19 GBGPU de 24 GB ou 32 GB de RAM

Os valores de memória são aproximados e dependem da versão quantizada que cada programa baixa. O tamanho do download é o que aparece no LM Studio em outubro de 2026.

O "E" de E2B e E4B significa "efetivo": o modelo tem mais parâmetros guardados, mas só usa 2 ou 4 bilhões por vez, o que economiza memória e bateria. O "A4B" do modelo de 26B indica que ele ativa só 3,8 bilhões de parâmetros a cada resposta, por isso responde quase tão rápido quanto um modelo pequeno, mas com qualidade de modelo grande.

Tabela do Google com os resultados de benchmark dos modelos Gemma 4 31B, 26B, E4B e E2B comparados ao Gemma 3 27B
Benchmarks divulgados pelo Google no lançamento. A última coluna é o Gemma 3 27B, da geração anterior. Fonte: Google.

Repare na última coluna da tabela: o Gemma 3 de 27 bilhões, lançado um ano antes, perde para o novo E4B em quase tudo, e o E4B cabe num celular. Esse é o salto real desta geração.

Arte do Google para o lançamento do Gemma 4 12B, com o texto Unified Transformer e ícones de imagem, texto e áudio entrando no modelo
O 12B chegou em junho de 2026 para notebooks com 16 GB. Fonte: Google.

O 12B foi lançado depois, em junho de 2026, para preencher o espaço entre o E4B e o 26B. Ele fica perto do 26B nos testes, com menos da metade da memória, e aceita áudio. Se você tem um notebook com 16 GB de RAM, é por ele que eu começaria.

3. Quando usar o Gemma 4 e quando ficar no Gemini ou no ChatGPT

Vale ser honesta: o Gemma 4 31B não é o Gemini 3 Pro. Os modelos que rodam na nuvem continuam mais capazes para tarefas difíceis, e você não precisa cuidar de instalação nenhuma.

O Gemma 4 faz sentido em quatro situações.

  1. O dado não pode sair da empresa. Contrato, prontuário, planilha de folha de pagamento. Com o modelo local, nada vai para fora.
  2. Você vai usar em volume. Cada pergunta a um modelo na nuvem custa tokens. No modelo local, o custo é a energia do computador.
  3. Não tem internet confiável. Avião, campo, fábrica, hospital.
  4. Você quer aprender como isso funciona por dentro. Rodar um modelo na própria máquina é a forma mais direta de entender tokens, contexto e memória.

Para pedir uma receita ou revisar um e-mail, o Gemini e o ChatGPT continuam sendo o caminho mais fácil.

4. Como testar sem instalar nada

Se você só quer sentir o modelo, não precisa baixar.

  • No computador, abra o Google AI Studio e escolha o Gemma 4 31B ou o 26B na lista de modelos. É de graça, com uma conta Google.
  • No celular, instale o aplicativo Google AI Edge Gallery (Android ou iPhone). Ele baixa o Gemma 4 E2B ou E4B para dentro do telefone e roda offline. Depois do download, dá para colocar em modo avião e continuar conversando.
Banner do Google AI Edge Gallery mostrando a tela de Agent Skills do aplicativo num celular, com o modelo Gemma 4 E2B listado
O AI Edge Gallery roda o Gemma 4 dentro do celular, sem internet. Fonte: Google.

5. Como baixar e rodar no seu computador

O jeito mais simples é o LM Studio, um programa gratuito e todo visual, para Windows, Mac e Linux. Não precisa abrir terminal nem digitar comando.

  1. Entre em lmstudio.ai e clique em Download. A instalação é a de qualquer programa.
  2. Abra o LM Studio. No menu da esquerda, clique na lupa (Discover) e procure por "gemma 4". A página oficial do modelo é lmstudio.ai/models/gemma-4.
  3. Escolha o tamanho (comece pelo E4B) e clique em Download. O LM Studio mostra, antes de baixar, se o modelo cabe na memória do seu computador. Isso evita a frustração de baixar 19 GB e descobrir que não roda.
  4. Quando terminar, clique no ícone de balão (Chat), selecione o Gemma 4 no topo da tela e mande a primeira mensagem.

A primeira resposta demora alguns segundos porque o modelo está sendo carregado na memória. Da segunda em diante fica rápido. Para mandar uma imagem ou um PDF junto com a pergunta, arraste o arquivo para dentro da conversa.


Rodar um modelo de IA no próprio computador deixou de ser coisa de pesquisador. Com o Gemma 4, um notebook comum vira um assistente que lê documentos, entende imagens e escreve código sem mandar nada para fora. Se você trabalha com dados e quer entender IA de verdade, instale um, teste com um arquivo seu e veja o que acontece.

Mosaico com as capas das formações da Etek

Conheça as formações da Etek

Karine Lago
Escrito por
Karine Lago

Fundadora da Etek, premiada 11 vezes pela Microsoft e especialista em Dados pela UFMG. Ensina Power BI, Excel e Inteligência Artificial para mais de 540 mil pessoas no YouTube.

Continue lendo

Ver todos os artigos →
DAX não é fórmula de Excel: o modelo mental que destrava tudo