Cloudflare Workers AI
Workers AI exécute l’inférence à la périphérie de Cloudflare — un Worker appelle un modèle sans aller-retour vers une ferme de GPU régionale. L’unité gratuite est de 10 000 neurones par jour, partagés sur le catalogue. Llama 3.3 70B, GPT-OSS 120B et Qwen 3.8 restent à ce niveau.
Workers AI exécute l’inférence à la périphérie de Cloudflare — un Worker appelle un modèle sans aller-retour vers une ferme de GPU régionale. L’unité gratuite est de 10 000 neurones par jour, partagés sur le catalogue. Llama 3.3 70B, GPT-OSS 120B et Qwen 3.8 restent à ce niveau.
La plus longue fenêtre gratuite est de 262K, sur Qwen 3.8 27B — aucun modèle 10M ici. Kimi K2.6, GLM 5.x et DeepSeek V4 sont réservés à Workers Paid. L’URL REST exige votre {account_id} ; dans un Worker, préférez le binding AI.
- Modèles gratuits
- 40
- Contexte max
- 262K
- Offre gratuite
- 10 000 neurones/jour
- Exigence
- Compte e-mail, sans carte
Point de terminaison
https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1CLOUDFLARE_API_TOKEN10K neurons per day (shared across models)- Compatible OpenAI
- texte
- image
- vidéo
- code
- raisonnement
Exemples de code
npm install openaiimport OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1',
apiKey: process.env.CLOUDFLARE_API_TOKEN
})
const response = await client.chat.completions.create({
model: '@cf/openai/gpt-oss-120b',
messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})
console.log(response.choices[0].message.content)pip install openaiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1",
api_key=os.environ["CLOUDFLARE_API_TOKEN"],
)
response = client.chat.completions.create(
model="@cf/openai/gpt-oss-120b",
messages=[{"role": "user", "content": "Explain closures in one paragraph."}],
)
print(response.choices[0].message.content)curl https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $CLOUDFLARE_API_TOKEN" \
-d '{
"model": "@cf/openai/gpt-oss-120b",
"messages": [{"role": "user", "content": "Explain closures in one paragraph."}]
}'Bon à savoir
- Remplacez {account_id} dans l’URL de base par votre identifiant de compte.
- Dans un Worker, utilisez plutôt le binding AI — il saute le saut réseau et le token.
- Kimi K2.6, GLM 5.2/5.3 et DeepSeek V4 sont réservés à Workers Paid. La plus longue fenêtre gratuite est de 262K sur Qwen 3.8 27B.
Modèles que vous obtenez gratuitement39
- GPT-OSS 120B
@cf/openai/gpt-oss-120b - GPT-OSS 20B
@cf/openai/gpt-oss-20b - Qwen 3.8 27B
@cf/qwen/qwen3.8-27b - Llama 3.3 70B
@cf/meta/llama-3.3-70b-instruct-fp8-fast - Llama 4 Scout
@cf/meta/llama-4-scout-17b-16e-instruct - Llama 3.1 8B Fast
@cf/meta/llama-3.1-8b-instruct-fast - Llama 3.1 8B FP8
@cf/meta/llama-3.1-8b-instruct-fp8 - Llama 3.2 11B Vision
@cf/meta/llama-3.2-11b-vision-instruct - Llama 3.2 1B
@cf/meta/llama-3.2-1b-instruct - Llama 3.2 3B
@cf/meta/llama-3.2-3b-instruct - Gemma 4 26B
@cf/google/gemma-4-26b-a4b-it - GLM 4.7 Flash
@cf/zai-org/glm-4.7-flash - Granite 4.0 H Micro
@cf/ibm/granite-4.0-h-micro - Nemotron 3 Super
@cf/nvidia/nemotron-3-120b-a12b - Qwen 3 30B A3B
@cf/qwen/qwen3-30b-a3b-fp8 - Qwen 2.5 Coder 32B
@cf/qwen/qwen2.5-coder-32b-instruct - QwQ 32B
@cf/qwen/qwq-32b - Mistral Small 3.1
@cf/mistralai/mistral-small-3.1-24b-instruct - DeepSeek R1 Distill 32B
@cf/deepseek-ai/deepseek-r1-distill-qwen-32b - Llama Guard 3 8B
@cf/meta/llama-guard-3-8b - Whisper Large V3 Turbo
@cf/openai/whisper-large-v3-turbo - BGE M3
@cf/baai/bge-m3 - BGE Base
@cf/baai/bge-base-en-v1.5 - EmbeddingGemma 300M
@cf/google/embeddinggemma-300m - FLUX.1 Schnell
@cf/black-forest-labs/flux-1-schnell - Qwen 3 Embedding 0.6B
@cf/qwen/qwen3-embedding-0.6b - Gemma 3 12B
@cf/google/gemma-3-12b-it - Llama 3.1 8B
@cf/meta/llama-3.1-8b-instruct - Mistral 7B
@cf/mistralai/mistral-7b-instruct-v0.2 - LLaVA 1.5 7B
@cf/llava-hf/llava-1.5-7b-hf - Whisper
@cf/openai/whisper - Nova 3
@cf/deepgram/nova-3 - MeloTTS
@cf/myshell-ai/melotts - Stable Diffusion XL
@cf/stabilityai/stable-diffusion-xl-base-1.0 - Resnet 50
@cf/microsoft/resnet-50 - BART Large CNN
@cf/facebook/bart-large-cnn - DistilBERT SST 2
@cf/huggingface/distilbert-sst-2-int8 - SQLCoder 7B
@cf/defog/sqlcoder-7b-2 - Phi 2
@cf/microsoft/phi-2