Model, Token, Context, dan Usage Limits
Pilih model dengan efisien dan pahami bahwa quota, unit, serta reset berbeda pada setiap provider.
Daftar isi
Model terbaik bukan model yang selalu paling mahal. Model terbaik adalah model yang dapat menyelesaikan task dengan benar pada latency, quota, dan biaya yang masuk akal.
1. LLM, Tokenizer, Token, Context
LLM
LLM (Large Language Model) adalah model yang memproses dan menghasilkan urutan token. Dalam AI coding, input dapat berupa prose, source code, diff, log, schema, dokumentasi, dan pada model multimodal juga image/screenshot.
Tokenizer
Tokenizer mengubah text/code menjadi token. Token bukan sinonim kata. Contoh source code dengan simbol, indentasi, identifier panjang, JSON, atau minified output dapat memakai banyak token.
Token
Token adalah unit yang dihitung model untuk input/output. API sering menetapkan harga berdasarkan token; subscription coding tools dapat mengubahnya menjadi request, credit, message, compute, atau usage window.
Context
Context adalah semua informasi yang model lihat untuk task saat ini. Context yang relevan lebih penting daripada sekadar context yang besar.
Context window
Context window adalah kapasitas maksimum context. Kapasitas besar berguna untuk codebase/documentation yang luas, tetapi jangan otomatis mengirim ribuan file. Gunakan repository search, file selection, summaries, dan task boundaries.
2. Kenapa Model Bisa “Lupa” atau Salah Meskipun Context Besar?
Beberapa penyebab umum:
- file penting tidak pernah dibaca;
- aturan penting tenggelam di antara noise;
- requirement saling bertentangan;
- context lama sudah tidak relevan;
- model mengandalkan asumsi daripada evidence;
- agent loop mengonsumsi budget/usage pada command dan tool output;
- model yang cepat dipakai untuk problem yang sebenarnya perlu reasoning lebih dalam.
Perbaikan:
kurangi scope
+ berikan source of truth
+ berikan file/error yang relevan
+ minta plan
+ jalankan test
+ review diff3. Model Families untuk AI Coding
Snapshot ini diverifikasi 2026-09-04. Model dan availability berubah cepat; anggap tabel sebagai orientation, bukan kontrak permanen.
| Provider | Model/family yang relevan untuk coding | Cara berpikir tentang pemakaian |
|---|---|---|
| OpenAI | GPT-5.6 Sol, Terra, Luna pada Codex/ChatGPT surfaces yang mendukungnya | Sol untuk hardest tasks, Terra untuk balanced daily coding, Luna untuk high-volume/simple tasks |
| Anthropic | Claude Fable 5.1, Opus 5, Sonnet 5, Haiku 4.5 | Fable/Opus untuk complex/long-horizon, Sonnet balanced, Haiku fast/lightweight |
| Gemini 3.8 Flash, Gemini 3.5 Flash-Lite; Gemini Pro variants untuk harder reasoning bila tersedia | Flash untuk coding/agentic balance, Flash-Lite untuk high volume, Pro untuk hardest planning/reasoning | |
| Z.AI | GLM-5.3, GLM-5.3-Flash pada current coding plan snapshot | GLM-5.3 untuk capability, Flash untuk faster/lighter work |
| Kimi/Moonshot | Kimi K3, K2.7 Code, K2.7 Code Highspeed, K2.6 | K2.7 Code untuk coding, Highspeed untuk throughput, K3 untuk long-horizon/high-capability workflows |
| xAI | Grok model family | Pertimbangkan bila tool/provider access sesuai kebutuhan; benchmark pada task Anda sendiri |
| Mistral | Mistral model family | Alternatif provider untuk general/coding workloads; evaluasi kualitas dan cost |
| DeepSeek | DeepSeek model family | Cost-sensitive option; tetap lakukan verification kuat |
| Open-weight/local | Qwen, Llama-derived coding models, dan lainnya | Privacy/control/offline use cases; butuh hardware, serving, dan eval sendiri |
Nama model berubah cepat. AI Blueprint sebaiknya menyimpan model registry dinamis dan tidak meng-hardcode klaim “best model” di artikel evergreen.
4. Tips Memilih Model Secara Efisien
Gunakan tiga tier:
Tier A - Fast / economical
Cocok untuk:
- format/transformasi;
- search summary;
- simple code explanation;
- rename kecil;
- test data;
- documentation cleanup;
- repetitive low-risk edits.
Tier B - Balanced
Cocok sebagai default:
- satu feature kecil;
- component + tests;
- bug dengan reproduksi jelas;
- API integration yang terdefinisi;
- UI dari
DESIGN.mddan mockup; - schema implementation additive.
Tier C - Complex
Gunakan bila:
- architecture decision;
- multi-service bug;
- security review;
- concurrency/idempotency;
- destructive migration;
- refactor lintas-modul besar;
- balanced model sudah gagal setelah context/evidence diperbaiki.
Prinsip routing:
mulai dari balanced
→ turunkan ke fast untuk subtask rutin
→ naikkan ke complex hanya bila task/risiko membutuhkannyaJangan meng-escalate model untuk menutupi prompt yang kabur. Perbaiki scope/context lebih dulu.
5. Model Selection Matrix
| Pertanyaan | Jika “ya” | Arah model |
|---|---|---|
| Hanya transformasi teks/code mekanis? | Risiko rendah | Fast |
| Perlu mengubah beberapa file dengan acceptance jelas? | Standard coding | Balanced |
| Bug tidak reproducible dan lintas service? | Reasoning tinggi | Complex |
| Ada migration destructive/security boundary? | High stakes | Complex + human review |
| Banyak screenshot/mockup? | Butuh vision | Model multimodal yang kuat |
| Task sangat panjang tetapi mudah? | Throughput | Fast/balanced dengan context strategy |
| Quota hampir habis? | Need conservation | Kurangi scope, gunakan fast tier, atau tunggu reset; jangan bypass policy |
6. Pahami Limits: 5 Jam dan 7 Hari Tidak Universal
Ini poin penting: tidak semua provider memakai aturan 5-hour + 7-day. Setiap product dapat memakai meter berbeda: messages, model requests, credits, tokens, compute, rate limit, daily quota, weekly quota, atau kombinasi.
OpenAI Codex / ChatGPT coding usage
Pada snapshot dokumentasi current, Codex plan usage dapat diukur dalam five-hour periods, dan weekly limits dapat berlaku. OpenAI juga memberi estimasi jumlah local messages per five-hour period untuk model/plan tertentu, tetapi estimasi tersebut bukan quota tetap karena konsumsi dipengaruhi model, panjang context, tool use, dan kompleksitas task.
Praktik pengguna:
- lihat usage dashboard/current plan;
- gunakan model lebih ringan untuk task rutin;
- kurangi context noise;
- jangan menjalankan agent loop tanpa batas;
- simpan checkpoint sehingga tidak perlu mengulang pekerjaan besar.
Sumber: https://learn.chatgpt.com/docs/pricing
Claude Code
Untuk plan Claude tertentu, UI menampilkan five-hour session dan weekly usage. Weekly usage dapat memiliki meter berbeda untuk model tertentu. Anthropic tidak menjanjikan satu angka message universal karena konsumsi dipengaruhi workload dan plan.
Praktik pengguna:
- gunakan Sonnet/balanced tier untuk mayoritas coding;
- gunakan high-capability tier selektif;
- review context dan command output agar session tidak boros;
- cek usage progress pada account Anda.
Sumber: https://support.claude.com/en/articles/9797557-usage-limit-best-practices
Gemini CLI / Gemini Code Assist
Gemini CLI tidak mengikuti satu aturan 5-hour/weekly universal. Pada snapshot 2026-09-04, dokumentasi Google menunjukkan quota harian model requests yang dibagikan dengan Code Assist agent mode, plus rate limits.
Snapshot published quotas yang perlu dianggap high-volatility:
| Access path | Published model requests/day snapshot |
|---|---|
| Individual | 1,000 |
| Google AI Pro | 1,500 |
| Google AI Ultra | 2,000 |
| API key free path | 250 |
| Code Assist Standard | 1,500 |
| Code Assist Enterprise | 2,000 |
Satu prompt pengguna dapat memicu lebih dari satu model request, jadi “1 prompt = 1 quota unit” tidak selalu benar.
Sumber:
- https://docs.cloud.google.com/gemini/docs/codeassist/quotas
- https://docs.cloud.google.com/gemini/docs/codeassist/resources/quotas
Z.AI GLM Coding Plan
Z.AI adalah contoh yang memang mendokumentasikan 5-hour credits + weekly credits pada coding plan snapshot ini.
| Plan | 5-hour credits | Weekly credits |
|---|---|---|
| Lite | 2,000 | 10,000 |
| Pro | 12,000 | 60,000 |
| Max | 28,000 | 140,000 |
Dokumentasi menyatakan 5-hour credits reset secara dinamis setelah window konsumsi dan weekly credits reset dalam siklus 7 hari. Promo sementara tidak boleh dianggap sebagai entitlement permanen.
Sumber: https://docs.z.ai/devpack/overview
OpenCode
OpenCode tidak memiliki satu quota provider-agnostic yang berlaku untuk semua orang. Karena OpenCode dapat memakai provider yang berbeda, limit mengikuti provider, API key, subscription, atau credit path yang dipilih.
Sumber: https://opencode.ai/docs/
Kimi Code
Pada review ini, satu angka public 5-hour/weekly yang stabil untuk semua Kimi Code plan tidak diverifikasi dari dokumentasi resmi yang tersedia. UI publik AI Blueprint harus menampilkan “check current plan/usage page” daripada mengarang angka.
Sumber:
7. Cara Membaca Usage Limit yang Benar
Saat melihat “limit”, tanyakan:
- Unit-nya apa: token, request, message, credit, compute?
- Window-nya apa: per minute, daily, 5-hour rolling, weekly?
- Reset-nya fixed clock atau rolling/dynamic?
- Limit per user, seat, org, model, atau account?
- Cloud task dan local task memakai meter sama atau beda?
- Satu prompt dapat memicu berapa model/tool requests?
- Apakah promo sementara?
- Apakah provider dapat menurunkan/menaikkan limit berdasarkan load/plan?
- Tanggal terakhir diverifikasi kapan?
8. Tips Menghemat Token, Quota, dan Waktu
- Berikan file yang relevan, jangan dump seluruh repo.
- Pisahkan “analyze” dan “implement”.
- Gunakan
PLAN.mdagar tidak mengulang reasoning yang sama. - Simpan stable rules di repository Markdown.
- Minta output ringkas dan evidence-focused.
- Jangan meminta agent menulis ulang file besar bila patch kecil cukup.
- Gunakan test/log konkret saat debugging.
- Hentikan loop setelah dua atau tiga percobaan yang tidak menghasilkan evidence baru; perbaiki diagnosis.
- Gunakan cheap/fast model untuk subtask rutin.
- Gunakan high-capability model hanya pada bottleneck yang benar-benar sulit.
- Commit stage yang selesai agar restart session tidak berarti restart seluruh task.
9. Model Routing untuk AI Blueprint Learning
Rekomendasi UX:
Simple task
→ Fast model
Normal feature/bug
→ Balanced model
Architecture/security/complex migration
→ Complex model
Model gagal
→ cek context + evidence + acceptance
→ baru escalateModel picker sebaiknya menampilkan rekomendasi task, bukan hanya nama model.
10. Freshness Rule
Karena model dan limit berubah cepat, public page harus menampilkan:
verified_at;- official source link;
- limit type;
- reset/window semantics;
- plan/model scope;
- exact versus estimate;
- next review date;
- “may have changed” warning setelah stale threshold.
Data snapshot machine-readable untuk paket ini tersedia di:
data/provider-coding-limits-2026-09-04.json
Snapshot usage limit provider
Diverifikasi 4 Sep 2026. Angka dan plan dapat berubah setelah tanggal ini.
OpenAI
Codex / ChatGPT coding usage
Anthropic
Claude Code / Claude subscription usage
Gemini CLI / Gemini Code Assist
Z.AI
GLM Coding Plan
OpenCode
OpenCode coding agent
Moonshot AI / Kimi
Kimi Code
Sumber resmi dan referensi
Gunakan sumber berikut untuk memeriksa command, fitur, pricing, atau limit terbaru.
Apakah panduan ini membantu?
Beritahu kami bila langkahnya berhasil atau ada informasi yang perlu diperbarui.