Cloudflare Workers AI
O Workers AI roda inferência na edge da Cloudflare, então um Worker chama um modelo sem voltar e voltar a uma fazenda de GPU regional. A unidade gratuita é de 10.000 neurônios por dia, compartilhados pelo catálogo. Llama 3.3 70B, GPT-OSS 120B e Qwen 3.8 ficam nesse nível.
O Workers AI roda inferência na edge da Cloudflare, então um Worker chama um modelo sem voltar e voltar a uma fazenda de GPU regional. A unidade gratuita é de 10.000 neurônios por dia, compartilhados pelo catálogo. Llama 3.3 70B, GPT-OSS 120B e Qwen 3.8 ficam nesse nível.
A maior janela gratuita é de 262K, no Qwen 3.8 27B — não tem modelo de 10M aqui. Kimi K2.6, GLM 5.x e DeepSeek V4 são só do Workers Paid. A URL REST precisa do seu {account_id}; dentro de um Worker, use o binding de AI.
- Modelos gratuitos
- 40
- Contexto máximo
- 262K
- Nível gratuito
- 10.000 neurônios por dia
- Requisito
- Conta de e-mail, sem cartão
Endpoint
https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1CLOUDFLARE_API_TOKEN10K neurons per day (shared across models)- Compatível com OpenAI
- texto
- imagem
- vídeo
- código
- raciocínio
Exemplos de código
npm install openaiimport OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1',
apiKey: process.env.CLOUDFLARE_API_TOKEN
})
const response = await client.chat.completions.create({
model: '@cf/openai/gpt-oss-120b',
messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})
console.log(response.choices[0].message.content)pip install openaiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1",
api_key=os.environ["CLOUDFLARE_API_TOKEN"],
)
response = client.chat.completions.create(
model="@cf/openai/gpt-oss-120b",
messages=[{"role": "user", "content": "Explain closures in one paragraph."}],
)
print(response.choices[0].message.content)curl https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $CLOUDFLARE_API_TOKEN" \
-d '{
"model": "@cf/openai/gpt-oss-120b",
"messages": [{"role": "user", "content": "Explain closures in one paragraph."}]
}'Vale saber
- Troque {account_id} na URL base pelo id da sua conta.
- Dentro de um Worker, use o binding de AI — pula o salto de rede e o token.
- Kimi K2.6, GLM 5.2/5.3 e DeepSeek V4 são exclusivos do Workers Paid. A maior janela gratuita é de 262K no Qwen 3.8 27B.
Modelos que você obtém de graça39
- GPT-OSS 120B
@cf/openai/gpt-oss-120b - GPT-OSS 20B
@cf/openai/gpt-oss-20b - Qwen 3.8 27B
@cf/qwen/qwen3.8-27b - Llama 3.3 70B
@cf/meta/llama-3.3-70b-instruct-fp8-fast - Llama 4 Scout
@cf/meta/llama-4-scout-17b-16e-instruct - Llama 3.1 8B Fast
@cf/meta/llama-3.1-8b-instruct-fast - Llama 3.1 8B FP8
@cf/meta/llama-3.1-8b-instruct-fp8 - Llama 3.2 11B Vision
@cf/meta/llama-3.2-11b-vision-instruct - Llama 3.2 1B
@cf/meta/llama-3.2-1b-instruct - Llama 3.2 3B
@cf/meta/llama-3.2-3b-instruct - Gemma 4 26B
@cf/google/gemma-4-26b-a4b-it - GLM 4.7 Flash
@cf/zai-org/glm-4.7-flash - Granite 4.0 H Micro
@cf/ibm/granite-4.0-h-micro - Nemotron 3 Super
@cf/nvidia/nemotron-3-120b-a12b - Qwen 3 30B A3B
@cf/qwen/qwen3-30b-a3b-fp8 - Qwen 2.5 Coder 32B
@cf/qwen/qwen2.5-coder-32b-instruct - QwQ 32B
@cf/qwen/qwq-32b - Mistral Small 3.1
@cf/mistralai/mistral-small-3.1-24b-instruct - DeepSeek R1 Distill 32B
@cf/deepseek-ai/deepseek-r1-distill-qwen-32b - Llama Guard 3 8B
@cf/meta/llama-guard-3-8b - Whisper Large V3 Turbo
@cf/openai/whisper-large-v3-turbo - BGE M3
@cf/baai/bge-m3 - BGE Base
@cf/baai/bge-base-en-v1.5 - EmbeddingGemma 300M
@cf/google/embeddinggemma-300m - FLUX.1 Schnell
@cf/black-forest-labs/flux-1-schnell - Qwen 3 Embedding 0.6B
@cf/qwen/qwen3-embedding-0.6b - Gemma 3 12B
@cf/google/gemma-3-12b-it - Llama 3.1 8B
@cf/meta/llama-3.1-8b-instruct - Mistral 7B
@cf/mistralai/mistral-7b-instruct-v0.2 - LLaVA 1.5 7B
@cf/llava-hf/llava-1.5-7b-hf - Whisper
@cf/openai/whisper - Nova 3
@cf/deepgram/nova-3 - MeloTTS
@cf/myshell-ai/melotts - Stable Diffusion XL
@cf/stabilityai/stable-diffusion-xl-base-1.0 - Resnet 50
@cf/microsoft/resnet-50 - BART Large CNN
@cf/facebook/bart-large-cnn - DistilBERT SST 2
@cf/huggingface/distilbert-sst-2-int8 - SQLCoder 7B
@cf/defog/sqlcoder-7b-2 - Phi 2
@cf/microsoft/phi-2