Ollama Lento ou Travando na VPS? Como Otimizar a Performance
O Ollama instalado, o modelo rodando, mas as respostas demoram muito ou o servidor trava durante o processamento? Antes de migrar para um plano maior, existem alguns ajustes que costumam resolver — ou pelo menos reduzir bastante o problema.
1. Confirme que o modelo cabe na RAM disponível
Rode free -h durante uma geração de resposta. Se a memória disponível chegar perto de zero, o sistema operacional começa a usar swap (disco), o que deixa tudo drasticamente mais lento. A solução aqui não é otimização — é usar um modelo menor ou mais RAM.
2. Use uma versão quantizada do modelo
Modelos quantizados (Q4, Q5) ocupam bem menos memória que a versão original, com perda de qualidade geralmente pequena para a maioria dos usos. O Ollama já baixa a versão quantizada por padrão na maioria dos modelos — confira o tag exato:
ollama pull llama3.2:3b-instruct-q4_0
3. Limite o número de modelos carregados simultaneamente
Se você usa mais de um modelo, o Ollama pode manter vários carregados na memória ao mesmo tempo. Ajuste a variável de ambiente para liberar memória entre usos:
OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_KEEP_ALIVE=5m
Onde configurar: essas variáveis vão no arquivo de serviço do systemd (/etc/systemd/system/ollama.service.d/override.conf) ou nas variáveis de ambiente do container, se você roda via Docker.
4. Monitore a temperatura e o throttling de CPU
Em VPS com CPU compartilhada, picos de uso prolongado podem sofrer limitação (throttling) por parte do provedor. Se a lentidão é inconsistente — rápido às vezes, lento em outras — vale confirmar com o suporte do seu provedor se há throttling na sua CPU, ou considerar um plano com CPU dedicada.
Se depois desses ajustes o desempenho ainda não for suficiente, o próximo passo é mesmo aumentar os recursos — veja no guia de VPS para rodar LLM local a tabela de RAM recomendada por modelo.