Cloudflare Workers AI
Workers AI는 Cloudflare 엣지에서 추론을 실행하므로, Worker가 모델을 부르기 위해 지역 GPU 팜을 왕복할 필요가 없습니다. 무료 단위는 하루 10,000 뉴런이며 카탈로그 전체가 공유합니다. Llama 3.3 70B, GPT-OSS 120B, Qwen 3.8이 이 티어에 있습니다.
Workers AI는 Cloudflare 엣지에서 추론을 실행하므로, Worker가 모델을 부르기 위해 지역 GPU 팜을 왕복할 필요가 없습니다. 무료 단위는 하루 10,000 뉴런이며 카탈로그 전체가 공유합니다. Llama 3.3 70B, GPT-OSS 120B, Qwen 3.8이 이 티어에 있습니다.
가장 긴 무료 윈도우는 262K로 Qwen 3.8 27B의 것 — 여기엔 10M 모델이 없습니다. Kimi K2.6, GLM 5.x, DeepSeek V4는 Workers Paid 전용입니다. REST URL에는 본인의 {account_id}가 필요합니다. Worker 안에서는 AI 바인딩을 대신 쓰세요.
- 무료 모델
- 40
- 최대 컨텍스트
- 262K
- 무료 요금제
- 일 10,000 뉴런
- 요구사항
- 이메일만, 카드 불필요
엔드포인트
기본 URL
https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1환경 변수
CLOUDFLARE_API_TOKEN속도 제한
10K neurons per day (shared across models)- OpenAI 호환
- 텍스트
- 이미지
- 비디오
- 코드
- 추론
코드 예시
npm install openaiimport OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1',
apiKey: process.env.CLOUDFLARE_API_TOKEN
})
const response = await client.chat.completions.create({
model: '@cf/openai/gpt-oss-120b',
messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})
console.log(response.choices[0].message.content)pip install openaiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1",
api_key=os.environ["CLOUDFLARE_API_TOKEN"],
)
response = client.chat.completions.create(
model="@cf/openai/gpt-oss-120b",
messages=[{"role": "user", "content": "Explain closures in one paragraph."}],
)
print(response.choices[0].message.content)curl https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $CLOUDFLARE_API_TOKEN" \
-d '{
"model": "@cf/openai/gpt-oss-120b",
"messages": [{"role": "user", "content": "Explain closures in one paragraph."}]
}'알아두면 좋은 점
- 베이스 URL의 {account_id}를 본인 계정 id로 바꾸세요.
- Worker 안에서는 AI 바인딩을 쓰세요 — 네트워크 홉과 토큰을 생략합니다.
- Kimi K2.6, GLM 5.2/5.3, DeepSeek V4는 Workers Paid 전용. 가장 긴 무료 윈도우는 Qwen 3.8 27B의 262K입니다.
무료로 받는 모델39
- GPT-OSS 120B
@cf/openai/gpt-oss-120b - GPT-OSS 20B
@cf/openai/gpt-oss-20b - Qwen 3.8 27B
@cf/qwen/qwen3.8-27b - Llama 3.3 70B
@cf/meta/llama-3.3-70b-instruct-fp8-fast - Llama 4 Scout
@cf/meta/llama-4-scout-17b-16e-instruct - Llama 3.1 8B Fast
@cf/meta/llama-3.1-8b-instruct-fast - Llama 3.1 8B FP8
@cf/meta/llama-3.1-8b-instruct-fp8 - Llama 3.2 11B Vision
@cf/meta/llama-3.2-11b-vision-instruct - Llama 3.2 1B
@cf/meta/llama-3.2-1b-instruct - Llama 3.2 3B
@cf/meta/llama-3.2-3b-instruct - Gemma 4 26B
@cf/google/gemma-4-26b-a4b-it - GLM 4.7 Flash
@cf/zai-org/glm-4.7-flash - Granite 4.0 H Micro
@cf/ibm/granite-4.0-h-micro - Nemotron 3 Super
@cf/nvidia/nemotron-3-120b-a12b - Qwen 3 30B A3B
@cf/qwen/qwen3-30b-a3b-fp8 - Qwen 2.5 Coder 32B
@cf/qwen/qwen2.5-coder-32b-instruct - QwQ 32B
@cf/qwen/qwq-32b - Mistral Small 3.1
@cf/mistralai/mistral-small-3.1-24b-instruct - DeepSeek R1 Distill 32B
@cf/deepseek-ai/deepseek-r1-distill-qwen-32b - Llama Guard 3 8B
@cf/meta/llama-guard-3-8b - Whisper Large V3 Turbo
@cf/openai/whisper-large-v3-turbo - BGE M3
@cf/baai/bge-m3 - BGE Base
@cf/baai/bge-base-en-v1.5 - EmbeddingGemma 300M
@cf/google/embeddinggemma-300m - FLUX.1 Schnell
@cf/black-forest-labs/flux-1-schnell - Qwen 3 Embedding 0.6B
@cf/qwen/qwen3-embedding-0.6b - Gemma 3 12B
@cf/google/gemma-3-12b-it - Llama 3.1 8B
@cf/meta/llama-3.1-8b-instruct - Mistral 7B
@cf/mistralai/mistral-7b-instruct-v0.2 - LLaVA 1.5 7B
@cf/llava-hf/llava-1.5-7b-hf - Whisper
@cf/openai/whisper - Nova 3
@cf/deepgram/nova-3 - MeloTTS
@cf/myshell-ai/melotts - Stable Diffusion XL
@cf/stabilityai/stable-diffusion-xl-base-1.0 - Resnet 50
@cf/microsoft/resnet-50 - BART Large CNN
@cf/facebook/bart-large-cnn - DistilBERT SST 2
@cf/huggingface/distilbert-sst-2-int8 - SQLCoder 7B
@cf/defog/sqlcoder-7b-2 - Phi 2
@cf/microsoft/phi-2