it's free*.ai

Diretório · verificado 2 Sep 2026

Execute modelos de IA na sua própria máquina

Sem limite de taxa para bater, sem chave para rotacionar e nada saindo do laptop — o único teto é o seu hardware. Estas são as execuções que valem a pena conhecer, de um CLI de uma linha ao servidor que a produção realmente usa.

Escolha pela forma em vez do benchmark: Ollama se quiser funcionando em um minuto, LM Studio se preferir não tocar num terminal, MLX num Mac com chip M, vLLM quando estiver servindo outras pessoas.

Ollama

CLI + servidor

Um comando e o modelo roda na sua máquina. Sem limites, sem cotas.

localhost:11434/v1

LM Studio

Aplicativo de desktop

Ollama com interface: descobrir, baixar e conversar localmente.

localhost:1234/v1

llama.cpp

Engine

O engine sobre o qual quase tudo o mais roda. C++ puro, sem dependências.

localhost:8080/v1

Jan

Aplicativo de desktop

Alternativa open source ao ChatGPT que funciona 100% offline.

localhost:1337/v1

GPT4All

Aplicativo de desktop

Converse com seus documentos localmente — nada sai do notebook.

Local RAG

vLLM

Servidor de inferência

O servidor de inferência que a produção usa de verdade. PagedAttention e batching contínuo, na sua própria GPU.

localhost:8000/v1

MLX

Apple Silicon

O framework de arranjos da Apple. Num Mac com chip M é o caminho local mais rápido.

localhost:8080/v1

llamafile

Binário único

Um único arquivo que é modelo e runtime ao mesmo tempo. Baixe, chmod +x, execute. Sem instalação.

localhost:8080/v1

KoboldCpp

Binário único

Um executável único em volta do llama.cpp, ajustado para textos longos e escrita criativa.

GGUF

Perguntas sobre estes

De quanta RAM preciso?

Um modelo de 7B quantizado em 4 bits cabe em cerca de 5 GB, então 8 GB de RAM rodam um confortavelmente. Modelos de 70B querem 40 GB ou mais. O Can I Run AI avalia sua máquina específica.

Um modelo local é tão bom quanto uma API gratuita?

Geralmente não. Os modelos que você roda em casa são menores que os que NVIDIA ou Groq servem de graça. O local vence em privacidade, uso offline e não ter limites nenhum.

Outras formas de dividir