Lewati ke konten utama
AI BlueprintAI Blueprint
Cara KerjaHasil Blueprint
Learn
Learning CenterSemua panduan publicMulai AI CodingFondasi untuk pemulaPelatihan Pemula8 modul dan 10 latihan publicModels & LimitsToken, context, dan quotaBlueprint to CodeDari Project ZIP ke implementasi
Untuk SiapaHargaFAQ
MasukMulai dari Ide
LearnMulai dari Ide
AI BlueprintAI Blueprint

Platform berbasis AI yang membantu Anda mengubah ide aplikasi mentah menjadi blueprint terstruktur.

Produk

Cara KerjaHasil BlueprintHargaFAQ

Learning

Learning CenterMulai AI CodingPelatihan PemulaModels & LimitsBlueprint to Code

Perusahaan

KontakKeamananDokumentasi

Legal

Syarat & KetentuanKebijakan RefundKebijakan PrivasiKebijakan CookieKebijakan RetensiSubprosesor
© 2026 CV DNA Konsultan · AI Blueprint
hello@aiblueprint.web.id
Jl. Arabika 8 Blok AA 1 No. 9, RT.001/RW.005, Pondok Kopi, Duren Sawit, Jakarta Timur, DKI Jakarta 13460, Indonesia
Learning/AI Coding
ModelsPemula sampai menengah

Model, Token, Context, dan Usage Limits

Pilih model dengan efisien dan pahami bahwa quota, unit, serta reset berbeda pada setiap provider.

7 menit bacaDiperiksa 4 Sep 2026Akses public
Informasi tool dan limit dapat berubah cepat.

Data ini diperiksa 4 Sep 2026. Konfirmasi kembali melalui dokumentasi provider sebelum instalasi atau keputusan pembelian.

Di halaman ini
1. LLM, Tokenizer, Token, ContextLLMTokenizerTokenContextContext window2. Kenapa Model Bisa “Lupa” atau Salah Meskipun Context Besar?3. Model Families untuk AI Coding4. Tips Memilih Model Secara EfisienTier A - Fast / economicalTier B - BalancedTier C - Complex5. Model Selection Matrix6. Pahami Limits: 5 Jam dan 7 Hari Tidak UniversalOpenAI Codex / ChatGPT coding usageClaude CodeGemini CLI / Gemini Code AssistZ.AI GLM Coding PlanOpenCodeKimi Code7. Cara Membaca Usage Limit yang Benar8. Tips Menghemat Token, Quota, dan Waktu9. Model Routing untuk AI Blueprint Learning10. Freshness Rule
Daftar isi
1. LLM, Tokenizer, Token, ContextLLMTokenizerTokenContextContext window2. Kenapa Model Bisa “Lupa” atau Salah Meskipun Context Besar?3. Model Families untuk AI Coding4. Tips Memilih Model Secara EfisienTier A - Fast / economicalTier B - BalancedTier C - Complex5. Model Selection Matrix6. Pahami Limits: 5 Jam dan 7 Hari Tidak UniversalOpenAI Codex / ChatGPT coding usageClaude CodeGemini CLI / Gemini Code AssistZ.AI GLM Coding PlanOpenCodeKimi Code7. Cara Membaca Usage Limit yang Benar8. Tips Menghemat Token, Quota, dan Waktu9. Model Routing untuk AI Blueprint Learning10. Freshness Rule

Model terbaik bukan model yang selalu paling mahal. Model terbaik adalah model yang dapat menyelesaikan task dengan benar pada latency, quota, dan biaya yang masuk akal.

1. LLM, Tokenizer, Token, Context

LLM

LLM (Large Language Model) adalah model yang memproses dan menghasilkan urutan token. Dalam AI coding, input dapat berupa prose, source code, diff, log, schema, dokumentasi, dan pada model multimodal juga image/screenshot.

Tokenizer

Tokenizer mengubah text/code menjadi token. Token bukan sinonim kata. Contoh source code dengan simbol, indentasi, identifier panjang, JSON, atau minified output dapat memakai banyak token.

Token

Token adalah unit yang dihitung model untuk input/output. API sering menetapkan harga berdasarkan token; subscription coding tools dapat mengubahnya menjadi request, credit, message, compute, atau usage window.

Context

Context adalah semua informasi yang model lihat untuk task saat ini. Context yang relevan lebih penting daripada sekadar context yang besar.

Context window

Context window adalah kapasitas maksimum context. Kapasitas besar berguna untuk codebase/documentation yang luas, tetapi jangan otomatis mengirim ribuan file. Gunakan repository search, file selection, summaries, dan task boundaries.

2. Kenapa Model Bisa “Lupa” atau Salah Meskipun Context Besar?

Beberapa penyebab umum:

  • file penting tidak pernah dibaca;
  • aturan penting tenggelam di antara noise;
  • requirement saling bertentangan;
  • context lama sudah tidak relevan;
  • model mengandalkan asumsi daripada evidence;
  • agent loop mengonsumsi budget/usage pada command dan tool output;
  • model yang cepat dipakai untuk problem yang sebenarnya perlu reasoning lebih dalam.

Perbaikan:

text
kurangi scope
+ berikan source of truth
+ berikan file/error yang relevan
+ minta plan
+ jalankan test
+ review diff

3. Model Families untuk AI Coding

Snapshot ini diverifikasi 2026-09-04. Model dan availability berubah cepat; anggap tabel sebagai orientation, bukan kontrak permanen.

ProviderModel/family yang relevan untuk codingCara berpikir tentang pemakaian
OpenAIGPT-5.6 Sol, Terra, Luna pada Codex/ChatGPT surfaces yang mendukungnyaSol untuk hardest tasks, Terra untuk balanced daily coding, Luna untuk high-volume/simple tasks
AnthropicClaude Fable 5.1, Opus 5, Sonnet 5, Haiku 4.5Fable/Opus untuk complex/long-horizon, Sonnet balanced, Haiku fast/lightweight
GoogleGemini 3.8 Flash, Gemini 3.5 Flash-Lite; Gemini Pro variants untuk harder reasoning bila tersediaFlash untuk coding/agentic balance, Flash-Lite untuk high volume, Pro untuk hardest planning/reasoning
Z.AIGLM-5.3, GLM-5.3-Flash pada current coding plan snapshotGLM-5.3 untuk capability, Flash untuk faster/lighter work
Kimi/MoonshotKimi K3, K2.7 Code, K2.7 Code Highspeed, K2.6K2.7 Code untuk coding, Highspeed untuk throughput, K3 untuk long-horizon/high-capability workflows
xAIGrok model familyPertimbangkan bila tool/provider access sesuai kebutuhan; benchmark pada task Anda sendiri
MistralMistral model familyAlternatif provider untuk general/coding workloads; evaluasi kualitas dan cost
DeepSeekDeepSeek model familyCost-sensitive option; tetap lakukan verification kuat
Open-weight/localQwen, Llama-derived coding models, dan lainnyaPrivacy/control/offline use cases; butuh hardware, serving, dan eval sendiri

Nama model berubah cepat. AI Blueprint sebaiknya menyimpan model registry dinamis dan tidak meng-hardcode klaim “best model” di artikel evergreen.

4. Tips Memilih Model Secara Efisien

Gunakan tiga tier:

Tier A - Fast / economical

Cocok untuk:

  • format/transformasi;
  • search summary;
  • simple code explanation;
  • rename kecil;
  • test data;
  • documentation cleanup;
  • repetitive low-risk edits.

Tier B - Balanced

Cocok sebagai default:

  • satu feature kecil;
  • component + tests;
  • bug dengan reproduksi jelas;
  • API integration yang terdefinisi;
  • UI dari DESIGN.md dan mockup;
  • schema implementation additive.

Tier C - Complex

Gunakan bila:

  • architecture decision;
  • multi-service bug;
  • security review;
  • concurrency/idempotency;
  • destructive migration;
  • refactor lintas-modul besar;
  • balanced model sudah gagal setelah context/evidence diperbaiki.

Prinsip routing:

text
mulai dari balanced
→ turunkan ke fast untuk subtask rutin
→ naikkan ke complex hanya bila task/risiko membutuhkannya

Jangan meng-escalate model untuk menutupi prompt yang kabur. Perbaiki scope/context lebih dulu.

5. Model Selection Matrix

PertanyaanJika “ya”Arah model
Hanya transformasi teks/code mekanis?Risiko rendahFast
Perlu mengubah beberapa file dengan acceptance jelas?Standard codingBalanced
Bug tidak reproducible dan lintas service?Reasoning tinggiComplex
Ada migration destructive/security boundary?High stakesComplex + human review
Banyak screenshot/mockup?Butuh visionModel multimodal yang kuat
Task sangat panjang tetapi mudah?ThroughputFast/balanced dengan context strategy
Quota hampir habis?Need conservationKurangi scope, gunakan fast tier, atau tunggu reset; jangan bypass policy

6. Pahami Limits: 5 Jam dan 7 Hari Tidak Universal

Ini poin penting: tidak semua provider memakai aturan 5-hour + 7-day. Setiap product dapat memakai meter berbeda: messages, model requests, credits, tokens, compute, rate limit, daily quota, weekly quota, atau kombinasi.

OpenAI Codex / ChatGPT coding usage

Pada snapshot dokumentasi current, Codex plan usage dapat diukur dalam five-hour periods, dan weekly limits dapat berlaku. OpenAI juga memberi estimasi jumlah local messages per five-hour period untuk model/plan tertentu, tetapi estimasi tersebut bukan quota tetap karena konsumsi dipengaruhi model, panjang context, tool use, dan kompleksitas task.

Praktik pengguna:

  • lihat usage dashboard/current plan;
  • gunakan model lebih ringan untuk task rutin;
  • kurangi context noise;
  • jangan menjalankan agent loop tanpa batas;
  • simpan checkpoint sehingga tidak perlu mengulang pekerjaan besar.

Sumber: https://learn.chatgpt.com/docs/pricing

Claude Code

Untuk plan Claude tertentu, UI menampilkan five-hour session dan weekly usage. Weekly usage dapat memiliki meter berbeda untuk model tertentu. Anthropic tidak menjanjikan satu angka message universal karena konsumsi dipengaruhi workload dan plan.

Praktik pengguna:

  • gunakan Sonnet/balanced tier untuk mayoritas coding;
  • gunakan high-capability tier selektif;
  • review context dan command output agar session tidak boros;
  • cek usage progress pada account Anda.

Sumber: https://support.claude.com/en/articles/9797557-usage-limit-best-practices

Gemini CLI / Gemini Code Assist

Gemini CLI tidak mengikuti satu aturan 5-hour/weekly universal. Pada snapshot 2026-09-04, dokumentasi Google menunjukkan quota harian model requests yang dibagikan dengan Code Assist agent mode, plus rate limits.

Snapshot published quotas yang perlu dianggap high-volatility:

Access pathPublished model requests/day snapshot
Individual1,000
Google AI Pro1,500
Google AI Ultra2,000
API key free path250
Code Assist Standard1,500
Code Assist Enterprise2,000

Satu prompt pengguna dapat memicu lebih dari satu model request, jadi “1 prompt = 1 quota unit” tidak selalu benar.

Sumber:

  • https://docs.cloud.google.com/gemini/docs/codeassist/quotas
  • https://docs.cloud.google.com/gemini/docs/codeassist/resources/quotas

Z.AI GLM Coding Plan

Z.AI adalah contoh yang memang mendokumentasikan 5-hour credits + weekly credits pada coding plan snapshot ini.

Plan5-hour creditsWeekly credits
Lite2,00010,000
Pro12,00060,000
Max28,000140,000

Dokumentasi menyatakan 5-hour credits reset secara dinamis setelah window konsumsi dan weekly credits reset dalam siklus 7 hari. Promo sementara tidak boleh dianggap sebagai entitlement permanen.

Sumber: https://docs.z.ai/devpack/overview

OpenCode

OpenCode tidak memiliki satu quota provider-agnostic yang berlaku untuk semua orang. Karena OpenCode dapat memakai provider yang berbeda, limit mengikuti provider, API key, subscription, atau credit path yang dipilih.

Sumber: https://opencode.ai/docs/

Kimi Code

Pada review ini, satu angka public 5-hour/weekly yang stabil untuk semua Kimi Code plan tidak diverifikasi dari dokumentasi resmi yang tersedia. UI publik AI Blueprint harus menampilkan “check current plan/usage page” daripada mengarang angka.

Sumber:

  • https://www.kimi.com/code
  • https://platform.kimi.ai/docs/overview

7. Cara Membaca Usage Limit yang Benar

Saat melihat “limit”, tanyakan:

  1. Unit-nya apa: token, request, message, credit, compute?
  2. Window-nya apa: per minute, daily, 5-hour rolling, weekly?
  3. Reset-nya fixed clock atau rolling/dynamic?
  4. Limit per user, seat, org, model, atau account?
  5. Cloud task dan local task memakai meter sama atau beda?
  6. Satu prompt dapat memicu berapa model/tool requests?
  7. Apakah promo sementara?
  8. Apakah provider dapat menurunkan/menaikkan limit berdasarkan load/plan?
  9. Tanggal terakhir diverifikasi kapan?

8. Tips Menghemat Token, Quota, dan Waktu

  • Berikan file yang relevan, jangan dump seluruh repo.
  • Pisahkan “analyze” dan “implement”.
  • Gunakan PLAN.md agar tidak mengulang reasoning yang sama.
  • Simpan stable rules di repository Markdown.
  • Minta output ringkas dan evidence-focused.
  • Jangan meminta agent menulis ulang file besar bila patch kecil cukup.
  • Gunakan test/log konkret saat debugging.
  • Hentikan loop setelah dua atau tiga percobaan yang tidak menghasilkan evidence baru; perbaiki diagnosis.
  • Gunakan cheap/fast model untuk subtask rutin.
  • Gunakan high-capability model hanya pada bottleneck yang benar-benar sulit.
  • Commit stage yang selesai agar restart session tidak berarti restart seluruh task.

9. Model Routing untuk AI Blueprint Learning

Rekomendasi UX:

text
Simple task
→ Fast model

Normal feature/bug
→ Balanced model

Architecture/security/complex migration
→ Complex model

Model gagal
→ cek context + evidence + acceptance
→ baru escalate

Model picker sebaiknya menampilkan rekomendasi task, bukan hanya nama model.

10. Freshness Rule

Karena model dan limit berubah cepat, public page harus menampilkan:

  • verified_at;
  • official source link;
  • limit type;
  • reset/window semantics;
  • plan/model scope;
  • exact versus estimate;
  • next review date;
  • “may have changed” warning setelah stale threshold.

Data snapshot machine-readable untuk paket ini tersedia di:

data/provider-coding-limits-2026-09-04.json

Snapshot usage limit provider

Diverifikasi 4 Sep 2026. Angka dan plan dapat berubah setelah tanggal ini.

OpenAI

Codex / ChatGPT coding usage

Estimate
5-hour usage windowweekly limit may apply
Periksa sumber

Anthropic

Claude Code / Claude subscription usage

Estimate
5-hour sessionweekly usage
Periksa sumber

Google

Gemini CLI / Gemini Code Assist

Exact
daily model requestsper minute rate limit
Periksa sumber

Z.AI

GLM Coding Plan

Exact
5-hour creditsweekly credits
Periksa sumber

OpenCode

OpenCode coding agent

Estimate
provider dependent
Periksa sumber

Moonshot AI / Kimi

Kimi Code

Estimate
plan dependentnot publicly verified in this snapshot
Periksa sumber

Sumber resmi dan referensi

Gunakan sumber berikut untuk memeriksa command, fitur, pricing, atau limit terbaru.

  • learn.chatgpt.com
  • support.claude.com
  • docs.cloud.google.com
  • docs.cloud.google.com
  • docs.z.ai
  • opencode.ai
  • kimi.com
  • platform.kimi.ai
Terkait dengan Blueprint

Technical Foundation

Hubungkan pilihan model dengan tingkat risiko dan kompleksitas implementasi.

Buka referensi
SebelumnyaTools & IDEBerikutnyaMarkdown & Worktree

Apakah panduan ini membantu?

Beritahu kami bila langkahnya berhasil atau ada informasi yang perlu diperbarui.

Perlu update