Ollama Lento ou Travando na VPS? Como Otimizar a Performance

Atualizado em setembro 19, 2026

Ilustração: Ollama Lento ou Travando na VPS? Como Otimizar a Performance

O Ollama instalado, o modelo rodando, mas as respostas demoram muito ou o servidor trava durante o processamento? Antes de migrar para um plano maior, existem alguns ajustes que costumam resolver — ou pelo menos reduzir bastante o problema.

1. Confirme que o modelo cabe na RAM disponível

Rode free -h durante uma geração de resposta. Se a memória disponível chegar perto de zero, o sistema operacional começa a usar swap (disco), o que deixa tudo drasticamente mais lento. A solução aqui não é otimização — é usar um modelo menor ou mais RAM.

2. Use uma versão quantizada do modelo

Modelos quantizados (Q4, Q5) ocupam bem menos memória que a versão original, com perda de qualidade geralmente pequena para a maioria dos usos. O Ollama já baixa a versão quantizada por padrão na maioria dos modelos — confira o tag exato:

ollama pull llama3.2:3b-instruct-q4_0

3. Limite o número de modelos carregados simultaneamente

Se você usa mais de um modelo, o Ollama pode manter vários carregados na memória ao mesmo tempo. Ajuste a variável de ambiente para liberar memória entre usos:

OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_KEEP_ALIVE=5m

Onde configurar: essas variáveis vão no arquivo de serviço do systemd (/etc/systemd/system/ollama.service.d/override.conf) ou nas variáveis de ambiente do container, se você roda via Docker.

4. Monitore a temperatura e o throttling de CPU

Em VPS com CPU compartilhada, picos de uso prolongado podem sofrer limitação (throttling) por parte do provedor. Se a lentidão é inconsistente — rápido às vezes, lento em outras — vale confirmar com o suporte do seu provedor se há throttling na sua CPU, ou considerar um plano com CPU dedicada.

Se depois desses ajustes o desempenho ainda não for suficiente, o próximo passo é mesmo aumentar os recursos — veja no guia de VPS para rodar LLM local a tabela de RAM recomendada por modelo.

Foto de Rodrigo Mendes de Oliveira
Escrito por

Rodrigo Mendes de Oliveira — Fundador do Ecossistema MR

Mais de 14 anos de experiência em SEO, formado em Sistemas de Informação (UNINOVE) e especialista em IA pelo MIT. Fundador da MR Tecnologia e vencedor do Silicon Valley Startup Award 2023 (StartSE).

Ver planos de VPS para começar