Model Routing & Reasoning Guide (2026)

Cẩm nang định tuyến AI model và tối ưu Reasoning Effort thực chiến: Fable cho tư duy kiến trúc/thiết kế, Sol cho engineering nặng/audit, Luna cho worker nhanh, Terra khám phá repo, cùng công thức 10 giây chọn Effort, quy trình multi-round và phòng tránh overthinking.

01Quick Reference & Công thức 10 giây

Tra cứu nhanh model và effort phù hợp nhất cho bài toán của bạn mà không cần đọc toàn bộ tài liệu:

Chọn Model Nhanh

LunaCần nhanh, rẻ, tác vụ đơn giản (Dịch, email, tóm tắt, regex, SQL ngắn)
TerraCông việc hằng ngày, coding thông thường (REST API, DB, unit test)
Opus 5Mạnh hơn Terra, xử lý logic phức tạp, refactor lớn, workflow nhiều bước
SolThiết kế hệ thống, kiến trúc, bài toán khó, microservice, enterprise
Fable 5Research, review cuối, security audit, CTO challenge, suy luận sâu nhất

Chọn Reasoning Effort

LightĐơn giản — 1 bước, 1 mục tiêu, không ràng buộc (Dịch, regex, tóm tắt)
LowĐơn giản có suy nghĩ — coding cơ bản, formula, SQL ngắn
Medium ⭐80–90% công việc — nhiều bước, có logic, có ràng buộc (REST API, SOP, DB)
HighBài toán khó — nhiều trade-off, không đáp án duy nhất (Microservice, multi-agent)
Extra HighThiết kế rất quan trọng — sai một ly đi một dặm (Enterprise HA, AI platform)
MaxMột bài khó, một agent — review cuối, challenge, audit. Không dùng để tạo bản đầu.
UltraNhiều agent song song — chỉ khi việc tách được thành phần độc lập. Tốn quota nhanh.
Công thức 10 giây (10-Second Decision Formula)
💡 Model mạnh + Medium thường tốt hơn Model yếu + Max.
🛡️ Đừng dùng Max để tạo — hãy dùng Max để phản biện (Audit, Challenge, Review).
⚡ Ultra không phải Sol thông minh hơn — Ultra là nhiều agent chạy song song.

02Hai yếu tố quyết định & Thứ tự IQ Model

Mỗi lần giao việc cho AI, chất lượng câu trả lời được quyết định bởi hai biến số độc lập:

Yếu tố Quyết định điều gì? Hình tượng tương đương
Model (Tier) Độ thông minh, chiều rộng kiến thức, khả năng tư duy trừu tượng, thẩm mỹ UI và xử lý bài toán lớn. IQ của chuyên gia
Reasoning Effort Thời gian AI dành để suy nghĩ, tự kiểm tra giả định, rà soát các phương án thay thế và tìm edge cases. Thời gian suy nghĩ

Hai trục độc lập: Tier (Phán đoán) & Effort (Kiểm chứng)

Chất lượng và chi phí vận hành AI coding được điều phối bởi 2 thang đo độc lập, tuyệt đối không quy đổi thay thế nhau:

Trục 1: Tier — Cook phải tự làm gì (Mức phán đoán cần có — Q1 & Q3) Tier
Thực hiện đúng chỉ dẫn: file:line có sẵn, thứ tự bước có sẵn, chỉ cần gõ code và chạy test; hoặc việc cơ học (chạy test suite, reindex, sync docs/features, dịch UAT). Luna
Khám phá repo có giới hạn: Tìm chỗ sửa khi đích đã rõ và phán đoán có phạm vi định sẵn (chọn giữa vài cách đã nêu, mở rộng theo mẫu có sẵn, component UI đơn giản). Terra / Opus
Phán đoán mở & Domain rộng: Chính sách chưa ai viết (null-date là cũ hay mới?), verdict trên số liệu, thiết kế 3 khối theo vai, review công thức, đọc nhiều module liên quan để hiểu mô hình trước khi sửa. Sol / Fable

💡 Câu hỏi để quyết định Tier:

“Nếu cook chọn sai ở bước này, có phải vì nó thiếu hiểu biết không?”
Có → Bắt buộc lên tier cao hơn (Sol / Fable). Không (chỉ là chưa kiểm kỹ từng bước) → Giữ nguyên tier, tăng Reasoning Effort.

Trục 2: Effort — Sai thì sao (Giá của một cái sai không bị bắt — Q2) Reasoning Effort
Sai thấy ngay: Thấy ngay khi mở màn hình (UI visual), hoặc test có sẵn bắt được; hoặc việc một lần, dễ làm lại (dịch, sync docs). Low (cơ học) / Medium (có code)
Sai âm thầm: Số tiền, ghi DB, quyền ghi (write permissions), công thức tính toán; test đếm dòng hay test cơ bản không bắt được. High
Đang tranh cãi một kết quả tiền cụ thể: Cần một lượt đào sâu để phân xử (red-team, review verdict holdout). Chỉ dùng cho review/audit, không bao giờ dùng cho cook! Extra High (Review only)
Bài toán đơn lẻ cực khó: Chấp nhận chờ lâu để giữ nguyên 1 chuỗi suy luận duy nhất (1 agent). Max

💡 Câu hỏi để quyết định Effort:

“Sai thì ai bắt, và bắt lúc nào?”
Bạn bắt lúc test tay trên màn hình → Medium đã đủ. Không ai bắt cho tới khi báo giá / hóa đơn đã gửi đến khách hàng → Bắt buộc High.

Ghép lại: 4 góc phối hợp & Cảnh báo Phản mẫu (Anti-Patterns)

Tier trả lời “ai làm”, Effort trả lời “kỹ tới đâu”. Bốn góc phối hợp chuẩn trong thực chiến:

Luna + Low / Medium

Cơ học: Chạy test suite, reindex, sync docs, dịch tài liệu UAT.

Terra + Medium

Cook có spec rõ, sai thấy ngay trên màn hình (Phase 10b, 11, 3, 7).

Terra + High

Cook có spec, phán đoán giới hạn, nhưng sai lặng lẽ trong logic ngầm (Phase 6).

Sol + High

Phán đoán mở và sai âm thầm (Phase 12, 13, 5B, 9, 14).

Lưu ý: Sol Medium phù hợp khi phán đoán mở nhưng sai thấy ngay (ví dụ 10a; hoặc khi bạn đang sẵn phiên Sol thì dùng tiếp cho Phase 11 vẫn hoàn toàn đúng).

⚠️ Cảnh báo Phản mẫu (Anti-patterns):

Không có ô nào hợp lý cho Sol Low hay Luna High: Tier cao mà không kiểm chứng (Sol Low) là lãng phí tài nguyên; Tier thấp mà ép suy nghĩ lâu (Luna High) thì dù có nghĩ thêm vẫn thiếu năng lực phán đoán mở và thiếu hiểu biết ngữ cảnh sâu.

Giải mã cú pháp: “Terra Medium (Sol Medium)”

Quy ước cú pháp: [Lựa chọn đề xuất tối ưu] ([Lựa chọn thay thế chấp nhận được]).

Tại sao Sol > Terra > Luna nhưng bảng lại khuyên dùng Terra Medium? Vì bảng không chọn “mạnh nhất” mà chọn “đủ cho việc đó”. Với việc cả 3 câu hỏi đều “không” (spec kê sẵn file:line, sai thấy trên màn hình), Terra Medium làm tốt ngang Sol Medium mà rẻ hơn nhiều. Sol Medium trong ngoặc nghĩa là nếu bạn đang mở sẵn session Sol thì dùng luôn cũng đúng, không cần tốn công chuyển đổi.

Tại sao không chọn Terra High (Sol Medium)? Vì Effort High không làm Terra thông minh bằng Sol; High chỉ khiến Terra quét toàn repo thừa thãi (“quét cả repo cho một sửa nhỏ”) và overthink tốn token. Terra High (Sol Medium) chỉ đúng khi phần khó là kiểm chứng cẩn thận chứ không phải phán đoán mở.

Thứ tự năng lực Model (Model IQ Hierarchy)

03Bốn vai chính (The Four Roles)

Coi roster là một team kỹ thuật hoàn chỉnh, không phải bảng xếp hạng đơn tuyến. Model đắt nằm ở đầu workflow — không phải mọi commit.

Fable 5

Architect / Product Engineer / Designer

Nằm ở đầu workflow. Suy nghĩ bài toán, challenge requirement, thiết kế domain, system architecture, UX flow và novel UI.

GPT-5.6 Sol

Senior Implementation Engineer / Auditor

Kỹ sư chủ lực giải quyết engineering khó: backend API, DB, auth, concurrency, audit, security, debug lỗi phức tạp và E2E testing.

GPT-5.6 Luna

Implementation Worker / Daily Driver

Thực thi công việc hằng ngày khi task đã rõ ràng và có PLAN.md: CRUD, form, boilerplate, test case lặp lại, rename, CSS spacing.

GPT-5.6 Terra

Explorer / Investigator

Thám tử điều tra khi chưa biết bug nằm ở đâu hoặc cần reverse engineer một repo lạ; lần theo dependency broad tracing trước khi Sol code.

04Bộ định tuyến task (Interactive Wizard)

Chọn đặc điểm task bên dưới để nhận model và effort level khuyến nghị ngay tức thì:

Khuyến nghị: —

05Routing mình khuyên dùng hằng ngày

Nếu chỉ nhớ một sơ đồ, hãy nhớ quy trình này: Spec chưa rõ thì để Fable nghĩ; sau đó tách theo mức độ ảnh hưởng (Luna vs Sol); qua Tests và Sol Review; chỉ Fable second-opinion với thay đổi trọng yếu.

Sơ đồ Routing thực chiến hằng ngày
Fable — Tư duy / Second Opinion Luna — Blast radius thấp Sol — Blast radius cao / Code Review Human — Merge

06Khi không biết code nằm đâu

Đừng implement vội khi chưa hiểu hệ thống. Hãy để Terra làm thám tử điều tra và lập bản đồ trước, sau đó Sol implement.

STEP 1
Repo chưa rõ / Chưa quen codebase
Chưa xác định được vị trí file hoặc luồng dữ liệu
↓
STEP 2
Terra Medium điều tra
Broad dependency tracing, reverse engineering flow, xác định blast radius
Terra Medium
↓
STEP 3
Root Cause & Impact Map hoàn tất
Danh sách chính xác các module và điểm cần chỉnh sửa
↓
STEP 4
Sol tiến hành Implementation
Viết code an toàn, test và hoàn thiện
Sol Medium / High

07Bảng task tổng hợp (30 Tasks)

Bảng định tuyến thực dụng từ kinh nghiệm thực chiến. Hàng gắn ★ là điểm có đồng thuận cộng đồng cao nhất.

Tác vụ Model tốt nhất Effort Backup / Reviewer

08Phân loại 4 Cấp độ & Ví dụ Thực tế

Tra cứu các mẫu prompt thực chiến và model khuyến nghị theo 4 cấp độ phức tạp:

Phân tầng độ phức tạp công việc
Công việc Prompt ví dụ Model Effort

09Phòng tránh Overthinking & Overengineering

Hiểu đúng về cái giá của Reasoning cao: AI suy nghĩ quá nhiều có thể tự sáng tạo thêm rào cản và giải quyết các bài toán chưa hề tồn tại.

Medium: Thiết kế sạch & Thực tế

Đáp ứng đúng bài toán CRUD API: Controller ➔ Service ➔ Repository ➔ Database. Gọn gàng, dễ test, bảo trì nhanh.

Max có nguy cơ đề xuất (Overengineering)

CQRS + Kafka + EventBus + Distributed Cache + Saga Orchestrator + Audit Service cho một ứng dụng nội bộ 50 người dùng.

So sánh: Thiết kế vừa đủ (Medium) vs Overengineering (Max)
Mức Reasoning ✅ Lợi ích thực tế ⚠️ Rủi ro Overengineering
Reasoning Cao (High / Max) Thử nhiều hướng, tự kiểm tra lỗi, tìm edge case ẩn, cân nhắc bảo mật và trade-off toàn diện. Thiết kế quá phức tạp, thêm abstraction thừa, tối ưu hóa quá sớm, giải quyết bài toán chưa tồn tại.
Reasoning Vừa (Medium ⭐) Tập trung đúng phạm vi, sinh code sạch, thời gian trả lời nhanh, tiết kiệm quota và chi phí. Có thể bỏ sót một vài edge case hiếm nếu prompt không nêu rõ ràng.

10Quy trình làm việc khuyến nghị (Multi-round Workflow)

Làm việc theo nhiều vòng lặp nhỏ (Draft ➔ Refine ➔ Review ➔ Challenge) luôn vượt trội so với cố gắng bắt AI tạo \"lời giải hoàn hảo tuyệt đối\" ngay từ prompt đầu tiên:

Quy trình 6 bước phân tầng Reasoning

11Rule of Thumb: Chọn Effort theo câu mở đầu Prompt

Nếu chưa biết chọn mức effort nào, hãy nhìn vào động từ mở đầu trong câu lệnh của bạn:

Nếu Prompt bắt đầu bằng… Effort khuyến nghị Ví dụ minh họa
"Làm giúp tôi…"Light / MediumViết email, viết code CRUD, tạo REST API, viết SQL query
"Thiết kế giúp tôi…"Medium ⭐Database schema, API contracts, workflow state machine, dashboard KPI
"So sánh và chọn…"HighPostgreSQL vs MongoDB? Kafka vs RabbitMQ? Sol vs Fable cho module này?
"Đánh giá / Review…"HighReview pull request, review kiến trúc microservice, kiểm toán query chậm
"Review code vừa viết…"HighCùng session, vài file → High. Auth/tiền/migration → Extra High. Săn mọi lỗ hổng → Max.
"Review plan nhiều file / phase…"HighThứ tự, file đụng, phụ thuộc → High. Coupling ẩn → Extra High. Nhánh độc lập → Ultra.
"Business logic / domain…"Medium / HighĐã biết file → Medium. Rule rải nhiều module → High. Đổi policy tiền/quyền → Extra High.
"Đã đủ context để tiếp tục?…"Medium ⭐Checklist đã biết / còn thiếu. Chưa biết data nằm đâu → Terra Medium trước.
"Tìm mọi rủi ro / edge cases…"MaxSecurity audit, scalability bottleneck, race condition trong distributed system
"Đóng vai Principal Architect / CTO…"MaxAudit toàn bộ hệ thống, challenge mọi assumption, phản biện kiến trúc trước khi release

12Fable 5 — Kiến trúc / Product / Designer

Đặt Fable 5 ở đầu workflow, không nhất thiết để nó viết toàn bộ code. Một developer 10+ năm kinh nghiệm chia sẻ: Fable vượt trội ở khả năng quy hoạch, UI taste, chủ động phản biện các yêu cầu vô lý và thiết kế hướng tới khả năng scale dài hạn.

Ví dụ: Đi một tính năng mới

"Thêm tính năng AI quotation vào hệ thống quản lý sản xuất nội thất."

Route ngay tới Fable 5 High để thực hiện: hiểu business context → challenge requirements → tìm edge cases bị thiếu → domain model & DB schema → workflow state machine → UX flow → spec implementation plan.

13GPT-5.6 Sol — Senior Implementation Engineer / Auditor

Nếu Fable là kiến trúc sư thì Sol là kỹ sư trưởng chịu trách nhiệm phần implementation khó và kiểm toán chất lượng. Sol có hiệu suất token tốt nhất và khả năng phân tích focused code review vượt trội.

Backend & Infrastructure

Service layer, API contracts, DB query optimization, concurrency, caching, message queues, deployment configs.

High Blast-Radius Code

Authentication, RBAC permissions, payment gateway, DB schema migrations, security checks, shared core libraries.

Sol là gì (OpenAI, 2026)

  • Flagship GPT-5.6 — Codex gọi là frontier agentic coding model. Alias API gpt-5.6 trỏ tới gpt-5.6-sol.
  • Context 1,050,000 token, output tối đa 128,000. Knowledge cutoff 16 Feb 2026. API default effort = medium.
  • Giá promo API: $4 / $20 mỗi 1M token (input/output) ít nhất đến 21 Nov 2026. Cached input $0.40.
  • Chọn Sol khi việc mở, khó, hoặc cần phán đoán/polish. Việc hẹp, lặp lại: Terra hoặc Luna.

Thang Effort của GPT-5.6 Sol

Effort là lượng suy luận của một agent. Ultra không nằm trên thang đó — Ultra đổi cách chạy thành nhiều agent song song. Codex CLI ghi Low; ChatGPT desktop / IDE ghi Light; API ghi low.

Bề mặt Light Medium High Extra High Max Ultra
Codex CLI Low Medium High Extra High Max More reasoning…
ChatGPT / IDE Light Medium High Extra High Max Ultra
API reasoning.effort low medium high xhigh max Không phải effort — multi-agent mode
CLI Low · API low
Light / Low
Nhanh, phạm vi đã rõ, sai cũng rẻ: giải thích 1 hàm, rename, SQL ngắn, tóm tắt log.
Default ⭐ · API medium
Medium
Cổng context, implement theo PLAN, giải thích domain đã biết, viết test cho code vừa xong.
Trần ngày · API high
High
Review code vừa viết, kiểm plan nhiều file/phase, dựng lại business logic xuyên module.
API xhigh
Extra High
Auth, tiền, migration, security review; High đã thất bại; plan có coupling ẩn.
Một agent · API max
Max
Một bài khó phải giữ nguyên chuỗi: ship/no-ship, challenge assumption, audit cuối.
4 agent mặc định
Ultra
Chỉ khi tách được phần độc lập (API / UI / migration riêng). Đừng dùng cho một chuỗi domain.

Max ≠ Ultra

Max cho một agent nghĩ lâu hơn trên một bài không tách được. Ultra chia việc cho vài agent chạy song song rồi ghép kết quả. Plan 5 phase dùng chung một domain model → Max hoặc Extra High. Plan tách được backend / frontend / migration độc lập → Ultra. Hầu hết task không cần cả hai.

Công thức chọn Effort cho Sol (review, plan, domain, context gate)

Cổng context — “AI đã đủ context chưa?”

Đây là checklist, không phải thiết kế hệ thống. Dùng Sol Medium (hoặc Terra Medium nếu chưa biết data nằm đâu). Kết quả phải là: đã biết / còn thiếu / được phép code tiếp hay phải đọc thêm. Đừng nhảy Extra High/Max — sẽ overthink và đốt quota trước khi implement.

Task thực chiến → Effort Sol

Bảng cho đúng những việc hay hỏi: review code vừa xong, review plan nhiều file/phase, hỏi business logic, và tự kiểm xem đã đủ context để tiếp tục.

Tác vụ Effort Vì sao mức này Đừng nâng lên

14GPT-5.6 Luna — Worker / Daily Driver

Đừng lãng phí Fable hay Sol vào các tác vụ cơ học: đổi button, thêm field, rename variable, CSS spacing, CRUD, mapping DTO, viết unit test lặp lại. Luna là lựa chọn kinh tế nhất khi task đã bounded.

Thang tăng cấp (Escalation Ladder) khi dùng Luna
Luna High ➔ Luna XHigh ➔ Sol Medium (khi kẹt)

15GPT-5.6 Terra — Explorer / Detective

Terra không dùng để làm default implementation model. Terra phát huy sức mạnh tối đa khi cần "truy vết diện rộng" (broad tracing) qua nhiều package/subsystem, phân tích ảnh hưởng khi chưa hiểu mã nguồn.

16E2E Browser Testing & Browser Automation

Với kiểm thử trình duyệt đầu-cuối (Playwright, Cypress, Browser agent), GPT-5.6 Sol là model chủ lực.

E2E browser testing đòi hỏi agent phải liên kết và tương quan chuỗi dữ liệu đa tầng:

🌐 Browser UI
Visual Render
➔
🎯 DOM / Selectors
Locators
➔
⚡ Frontend State
React/Zustand
➔
📡 Network & API
HTTP/Payloads
➔
🛠️ Backend Logic
Handlers
➔
💾 Database
Side-effects
➔
💼 Expected Output
Business Match
Tác vụ E2E / Browser Automation Model khuyến nghị Effort

Quy trình E2E hằng ngày (Everyday Workflow)

E2E Task ➔ Simple: Luna High | Complex: Sol Medium ➔ RUN ➔ Fail / Flaky: Sol High Debug

17Khi Fable 5 hết quota — Fallback Strategy

Khi Fable 5 chạm mốc 0 quota, không có một model thay thế hoàn hảo duy nhất. Cách tiếp cận đúng là phân nhánh theo 3 trụ cột:

Opus 5 / Kimi K3
1. Tư duy & Kiến trúc

Brainstorm, PRD, challenge requirement, system architecture.

Backup: GLM-5.3 Max / Sol High
Kimi K3 Max (2.8T)
2. UI & Frontend Design

Thiết kế UI/UX mới, concept, layout cần taste thẩm mỹ cao (Native Vision).

Backup: Qwen3.8-Max
Sol High / GLM-5.3
3. Kỹ thuật & Implementation

Backend, API, DB migrations, security, deep debug.

Backup: DeepSeek V4 Pro
Quy trình Feature mới khi Fable chạm mốc 0 Quota
Opus 5 / Kimi K3 — Brainstorm / PRD / Kiến trúc Kimi K3 Max — UI Design & Vision GLM-5.3 / Sol — Backend & Audit DeepSeek V4 Pro — Implementation

Ma trận Fallback chi tiết (19 Tasks)

Task (thường giao Fable 5) Fallback tốt nhất (1st) Lựa chọn 2 (2nd) Lựa chọn 3 (3rd)

18So sánh 7 model thay thế Fable & Benchmarks

Đánh giá khách quan dựa trên chỉ số Artificial Analysis Index, AA-Briefcase, DeepSWE, TerminalBench 2.1 & 3, và AutomationBench:

Model AA Intelligence Index So với Fable 5 Đánh giá & Vai trò
Claude Fable 5 Max62100% (Mốc tham chiếu)🥇 Frontier Architect & UI Taste
Kimi K3 Max (2.8T)60Cực kỳ sát (95%)⭐⭐⭐⭐⭐ Gần Fable nhất (Native Vision, AA-Briefcase 1540)
GLM-5.3 Max (753B)60Cực kỳ sát (95%)⭐⭐⭐⭐⭐ Đối trọng kinh tế số 1 ($56 Pro, Claude Code)
Qwen3.8 2.4T / Max58Rất gần (90%)⭐⭐⭐⭐½ Rất mạnh UI & Frontend ($2/$6 API)
DeepSeek V4 Pro (1.6T)53Có khoảng cách⭐⭐⭐⭐ Senior Implementation Worker (MIT, $0.435)
DeepSeek V4 Flash (284B)52Worker thuần túy⭐⭐⭐½ Sub-agent & Worker giá siêu rẻ ($0.14/1M)

Claude Opus 5 9.0/10

$5 / $25 per 1M tokens · 1M Context Window

Gần Fable nhất ở reasoning: Xuất sắc ở deep planning và agentic coordination. Giá rẻ bằng 1/2 Fable.

Lưu ý: Đôi khi quá tự tin khi đưa ra kết luận chưa trọn vẹn, cần Sol review code kỹ.

GPT-5.6 Sol 9.5/10 (Eng)

$5 / $30 per 1M tokens · Frontier Coding

Kỹ sư số 1: Mạnh nhất cho backend, DB, migrations, audit, security và multi-file refactoring (Dẫn đầu DeepSWE 72.7 & TerminalBench 3: 34.6).

Điểm yếu: Thiếu "taste" thẩm mỹ tự nhiên ở novel UI; không nên lạm dụng Sol Ultra.

Kimi K3 Max 9.5/10 (UI/Arch)

2.8T MoE · 1M Context · Native Vision · AA-Briefcase 1540

Đỉnh cao UI & Vision (2.8T MoE): AA Index 60 (sát Fable 62). Dẫn đầu AA-Briefcase (1540 - vượt Sol 1504). Đạt 90–95% năng lực Fable.

Native Vision: Cho phép gửi trực tiếp Mockup + UI code + Screenshot browser để tự lặp trực quan.

GLM-5.3 Max 9.0/10 (Value)

Z.ai Coding Plan ($56/mo) · AutomationBench 48.2

Kỳ đài Agentic Coding ($56 Pro): AA Index 60, dẫn đầu AutomationBench (48.2), tích hợp chính thức Claude Code với hơn 20 tools.

Kinh tế vượt trội: Gói GLM Coding Pro ($56 promo) cung cấp 6x quota, là đối trọng kinh tế số 1 của ChatGPT Pro $100.

Qwen3.8 2.4T / Max 8.5/10

2.4T Open Weights · ~$2 / $6 per 1M tokens API

Open Weights 2.4T / Qwen3.8-Max: AA Index 58. Rất mạnh ở UI/frontend và product layouts với giá API siêu rẻ ($2/$6).

DeepSeek V4 Pro 9.0/10 (Worker)

1.6T MoE · MIT License · $0.435 / $0.87 per 1M

V4 Pro 1.6T (MIT License): AA Index 53. Giá $0.435/$0.87. Hoàn hảo cho Senior Implementation Worker (backend/API/DB).

DeepSeek V4 Flash 9.8/10 (Cost)

284B MoE · $0.14 / $0.28 per 1M tokens

V4 Flash 284B ($0.14/$0.28): Model worker/subagent siêu tiết kiệm cho tác vụ lặp lại hàng loạt.

Benchmark (Thực chiến) GLM 5.3 Kimi K3 DeepSeek V4 Qwen 3.8 Fable 5 Sol 5.6
TerminalBench 2.188.288.387.986.688.088.8
DeepSWE 1.166.967.562.756.669.772.7
AutomationBench (Agent)48.246.743.239.846.245.8
TerminalBench 3 (Hard)28.317.4——33.734.6
AA-Briefcase (Knowledge Work)—1540——15741504

19Phân loại 4 tầng & Thứ tự ưu tiên

Cấu trúc định tuyến mới phân bổ sức mạnh theo từng domain kỹ thuật cụ thể:

1. Kiến trúc & Lập kế hoạch (Architecture / Planning)
Fable 5 ≈ Opus 5 ➔ Kimi K3 Max ≈ GLM-5.3 Max ➔ Qwen 3.8 ➔ DeepSeek V4 Pro
2. Coding khó & Debug sâu (Hard Coding / Debugging)
Sol 5.6 (No.1) ➔ Fable 5 ≈ Kimi K3 ≈ GLM-5.3 ➔ DeepSeek V4 Pro ➔ Qwen 3.8
3. UI & Frontend (Taste & Thẩm mỹ)
Fable 5 ≈ Kimi K3 Max ➔ Qwen3.8-Max ➔ Opus 5 ➔ Sol ➔ GLM-5.3
4. Worker rẻ / Tối ưu chi phí (Cheap Implementation Value)
DeepSeek Flash ($0.14) ➔ DeepSeek Pro ($0.435) ➔ Qwen 3.8 ($2) ➔ GLM-5.3 ($56/mo Pro)

20Thực tế về Open-Weight: Kích thước & Giấy phép

Cần phân biệt rõ: Open-weight KHÔNG đồng nghĩa với local model có thể chạy trên máy bàn thông thường. Kimi K3 (2.8T), Qwen 3.8 (2.4T), DeepSeek V4 Pro (1.6T) là các mô hình quy mô Datacenter. Cách dùng thực tế hiệu quả nhất là qua inference API rẻ hoặc các gói Coding subscription (Claude Code / OpenCode / Kimi Code).

Model Tham số (Params) Weights Giấy phép (License) Khả năng triển khai

21Ba cấu hình chi phí ($300 vs $260–$290 vs Lean)

So sánh các phương án ngân sách thực tế cho senior full-stack developer:

Option A: Cặp đôi Frontier Đỉnh cao ($300/tháng)

Claude Max 20x ($200) + ChatGPT Pro 5x ($100)

Fable lo nghĩ/UI, Sol Medium làm coding mặc định, Sol High audit, Luna worker, Terra explore. Setup cân bằng, không lãng phí Fable.

Option B: 4 Family Powerhouse ($260–$290/tháng)

Claude Max 20x ($200) + GLM Pro ($56) + DeepSeek + Kimi K3

Fable High làm kiến trúc chính. Khi cạn quota: Kimi K3 Max làm architect fallback, GLM-5.3 Pro làm secondary engineer, DeepSeek V4 Pro/Flash làm worker.

Option C: Ultra-Lean Starter (~$260/tháng)

Claude Max 20x + GLM Coding Pro + DeepSeek API

Tận dụng Fable/Opus trên Claude Max, GLM-5.3 cho coding nặng, DeepSeek cho worker. Chỉ bật Kimi K3 khi cần visual UI đặc thù.

22Bảng định tuyến AgentKit / Workflow (12 Tasks)

Bảng phân luồng chi tiết giữa Primary Model và Phương án Fallback khi Fable hết quota:

AgentKit / Workflow Task Primary Model Fallback khi Fable hết Quota

23Có nên bỏ thêm $100/tháng mua ChatGPT Pro 5x?

Lời khuyên thực tế nhất lúc này là: Đừng vội mua ngay.

Hãy dùng thử 1 tháng cấu hình: Claude Max 20x + GLM Coding Pro + DeepSeek API (với Kimi K3 làm Fable overflow). Nếu sự kết hợp này xử lý tốt codebase thực tế của bạn mà không tốn công điều chỉnh lặp lại, bạn hoàn toàn có thể tiết kiệm $100/tháng.

Nếu bạn liên tục nhận thấy GLM/Kimi giải quyết được 80–90% task nhưng Sol one-shot vượt trội ở 10–20% ca hóc búa nhất (như minh chứng từ TerminalBench 3: Sol 34.6 vs GLM 28.3 vs Kimi 17.4), thì lúc đó mua ChatGPT Pro 5x là hoàn toàn xứng đáng.

24Đừng dùng Ultra mặc định

Nghĩ nhiều hơn không đồng nghĩa luôn tốt hơn. Ultra không phải nấc trên Max — Ultra đổi cách chạy (nhiều agent), nên dễ scope-creep và đốt quota.

Light / Low
Một bước, phạm vi rõ, sai cũng rẻ. Codex CLI gọi là Low.
Medium ⭐
Mặc định cho 80–90% task (Luna, Sol, Terra, Opus).
High (Trần ngày)
Mức trần chuẩn cho kiến trúc, auth, DB và production code.
Extra High / XHigh
Chỉ dùng khi High thất bại hoặc nút thắt đa file phức tạp.
Max
Một agent, một bài khó phải giữ nguyên chuỗi. Review / audit / challenge — không tạo bản đầu.
Ultra
Nhiều agent song song khi việc tách được. Đừng dùng cho một domain model dùng chung.

Quy tắc 1 dòng cho Sol

Context gate & implement theo plan → Medium. Review code vừa viết / plan nhiều phase / domain xuyên module → High. Auth-tiền-migration hoặc High thất bại → Extra High. Một phán quyết ship/no-ship → Max. Nhiều nhánh độc lập → Ultra.

25Workflow full-stack production (5 Phases)

Phase 1
Think
Brainstorm, challenge, PRD, architecture, UX flow, plan.
Fable 5 High
Phase 2
Verify Plan
Feasibility, security, DB schema, API, race conditions.
Sol High
Phase 3
Build
Task nhỏ → Luna High. Thường → Luna XHigh / Sol Med. Khó → Sol High.
Luna / Sol
Phase 4
Review
Sol High kiểm toán correctness. Fable High review kiến trúc.
Sol + Fable
Phase 5
Human
Diff, tests, migrations, API compat, security và Merge.
Merge

Quy tắc ghi trong Plan & 3 câu hỏi cho từng Phase

Mỗi khi lập hoặc rà soát Phase trong PLAN.md, bắt buộc đánh giá qua 3 câu hỏi:

(1) Quyết định spec

Cook phải tự quyết điều spec không kê được?

(2) Sai âm thầm

Sai có âm thầm không (tiền, DB, quyền ghi, công thức)?

(3) Đọc rộng codebase

Phải đọc rộng nhiều module trước khi sửa?

📐 Quy tắc tính điểm & Routing:

Một “có” = High effort; Hai “có” trở lên = Tier cao nhất (Fable / Sol); Cả 3 “không” (no/no/no) = Terra Medium (hoặc Luna cho việc thuần cơ học).

🛡️ Các rào chắn an toàn (Safety Guardrails):

  • Extra High và Max: KHÔNG BAO GIỜ dùng cho cook, chỉ dùng cho red-team hoặc review kết quả tiền đang tranh cãi. Dữ liệu thực nghiệm 5.5 cho thấy xhigh tụt performance dưới High khi làm agentic coding vì nghĩ quá nhiều / đi lạc; OpenAI cũng chỉ khuyến cáo dùng khi eval chứng minh có lợi.
  • Ultra: Không dùng trên cây làm việc chung (tránh phân mảnh context và xung đột branch).
  • Quy tắc DONE_WITH_CONCERNS: Nếu cùng một phase bị DONE_WITH_CONCERNS 2 lần liên tiếp → Tăng một bậc effort cùng tier, hoặc lấy ý kiến đối chiếu từ hãng kia (Claude ↔ GPT); tuyệt đối không tùy tiện nhảy tier.
  • Gatekeeper: Fable vẫn giữ vai trò Gate chốt plan và kiến trúc ở phiên này.

Bảng gợi ý Routing 13 Phase thực chiến

Phase Nhiệm vụ cụ thể (Việc còn lại) Q1 / Q2 / Q3 Claude GPT
Phase 3 vision re-rank no / no / no Opus Medium Terra Medium (Sol Med)
Phase 10b fold, ngăn Nguồn, hero dedupe, R4.8c no / no / no Opus Medium Terra Medium (Sol Med)
Phase 11 chat front door (đang chạy Sol Medium, đúng) no / no / no Opus Medium Sol Medium (Terra Med)
Phase 12 24 tháng + fallback, null-date, money key, verdict yes / yes / yes Fable High Sol High
Phase 12 verdict quyết milestone B (đọc verdict) yes / yes / no Fable High Sol High (1 lượt xhigh chỉ khi tranh cãi)
Phase 13 formula review, report only yes / yes / yes Fable High Sol High + ý kiến hãng kia
Phase 14 Builder 3 khối theo vai yes / no / partly Fable High (Opus High nếu kê mockup trước) Sol High (Terra High với mockup)
Phase 5B (hoãn) trợ lý tác động lên Builder yes / yes / yes Fable High Sol High
Phase 6 (hoãn) composition, mở rộng loại yes / no / yes Opus High Terra High (Sol Med)
Phase 7 (hoãn) loại đơn variants no / no / no Opus Medium Terra Medium
Phase 9 (parked) CAD/vision điền template yes / yes / yes Fable High Sol High
Việc cơ học chạy suite, reindex, sync docs/features, dịch UAT no / no / no Opus Low Luna Medium
Plan work debate, red-team, gate yes / yes / yes Fable High Sol High (Grok xhigh làm tiếng nói ngoài)

Ghi chú Chi phí & Benchmark (Artificial Analysis)

Theo dữ liệu Artificial Analysis: Sol Max bám sát Fable trong khoảng 1 điểm năng lực với mức chi phí chỉ bằng khoảng một nửa. Do đó, cột GPT là lựa chọn mặc định tiết kiệm chi phí khi hai bên ngang nhau; cột Claude ưu tiên khi phase chạm vào lịch sử quyết định cốt lõi của plan mà controller đang nắm giữ.

26Bảng vai (Roster Summary)

Cấu hình khuyến nghị hoàn chỉnh cho senior full-stack engineer:

🧠 Architect / UI / PRDFable 5 High
🔍 Repo ExplorerTerra Medium
⚙️ Main EngineerSol Medium / High
🐛 Hard DebuggerSol High / XHigh
🌐 E2E Browser TestingSol Medium / High
🔐 Security / Auth / DBSol High
🔎 Code AuditorSol High
🔧 Worker / Routine CodeLuna High / XHigh
🥊 Second OpinionFable ↔ Sol
🧠 Fallback (Thinking)Kimi K3 Max / Opus
🎨 Fallback (UI / Frontend)Kimi K3 / Qwen
☢️ Max (một chuỗi khó)Review, Audit & Challenge — không tạo bản đầu
⚡ Ultra (nhiều agent)Chỉ khi việc tách được thành phần độc lập