Model Routing & Reasoning Guide (2026)
Cẩm nang định tuyến AI model và tối ưu Reasoning Effort thực chiến: Fable cho tư duy kiến trúc/thiết kế, Sol cho engineering nặng/audit, Luna cho worker nhanh, Terra khám phá repo, cùng công thức 10 giây chọn Effort, quy trình multi-round và phòng tránh overthinking.
01Quick Reference & Công thức 10 giây
Tra cứu nhanh model và effort phù hợp nhất cho bài toán của bạn mà không cần đọc toàn bộ tài liệu:
Chọn Model Nhanh
| Luna | Cần nhanh, rẻ, tác vụ đơn giản (Dịch, email, tóm tắt, regex, SQL ngắn) |
| Terra | Công việc hằng ngày, coding thông thường (REST API, DB, unit test) |
| Opus 5 | Mạnh hơn Terra, xử lý logic phức tạp, refactor lớn, workflow nhiều bước |
| Sol | Thiết kế hệ thống, kiến trúc, bài toán khó, microservice, enterprise |
| Fable 5 | Research, review cuối, security audit, CTO challenge, suy luận sâu nhất |
Chọn Reasoning Effort
| Light | Đơn giản — 1 bước, 1 mục tiêu, không ràng buộc (Dịch, regex, tóm tắt) |
| Low | Đơn giản có suy nghĩ — coding cơ bản, formula, SQL ngắn |
| Medium ⭐ | 80–90% công việc — nhiều bước, có logic, có ràng buộc (REST API, SOP, DB) |
| High | Bài toán khó — nhiều trade-off, không đáp án duy nhất (Microservice, multi-agent) |
| Extra High | Thiết kế rất quan trọng — sai một ly đi một dặm (Enterprise HA, AI platform) |
| Max | Một bài khó, một agent — review cuối, challenge, audit. Không dùng để tạo bản đầu. |
| Ultra | Nhiều agent song song — chỉ khi việc tách được thành phần độc lập. Tốn quota nhanh. |
02Hai yếu tố quyết định & Thứ tự IQ Model
Mỗi lần giao việc cho AI, chất lượng câu trả lời được quyết định bởi hai biến số độc lập:
| Yếu tố | Quyết định điều gì? | Hình tượng tương đương |
|---|---|---|
| Model (Tier) | Độ thông minh, chiều rộng kiến thức, khả năng tư duy trừu tượng, thẩm mỹ UI và xử lý bài toán lớn. | IQ của chuyên gia |
| Reasoning Effort | Thời gian AI dành để suy nghĩ, tự kiểm tra giả định, rà soát các phương án thay thế và tìm edge cases. | Thời gian suy nghĩ |
Hai trục độc lập: Tier (Phán đoán) & Effort (Kiểm chứng)
Chất lượng và chi phí vận hành AI coding được điều phối bởi 2 thang đo độc lập, tuyệt đối không quy đổi thay thế nhau:
| Trục 1: Tier — Cook phải tự làm gì (Mức phán đoán cần có — Q1 & Q3) | Tier |
|---|---|
| Thực hiện đúng chỉ dẫn: file:line có sẵn, thứ tự bước có sẵn, chỉ cần gõ code và chạy test; hoặc việc cơ học (chạy test suite, reindex, sync docs/features, dịch UAT). | Luna |
| Khám phá repo có giới hạn: Tìm chỗ sửa khi đích đã rõ và phán đoán có phạm vi định sẵn (chọn giữa vài cách đã nêu, mở rộng theo mẫu có sẵn, component UI đơn giản). | Terra / Opus |
| Phán đoán mở & Domain rộng: Chính sách chưa ai viết (null-date là cũ hay mới?), verdict trên số liệu, thiết kế 3 khối theo vai, review công thức, đọc nhiều module liên quan để hiểu mô hình trước khi sửa. | Sol / Fable |
💡 Câu hỏi để quyết định Tier:
“Nếu cook chọn sai ở bước này, có phải vì nó thiếu hiểu biết không?”
Có → Bắt buộc lên tier cao hơn (Sol / Fable). Không (chỉ là chưa kiểm kỹ từng bước) → Giữ nguyên tier, tăng Reasoning Effort.
| Trục 2: Effort — Sai thì sao (Giá của một cái sai không bị bắt — Q2) | Reasoning Effort |
|---|---|
| Sai thấy ngay: Thấy ngay khi mở màn hình (UI visual), hoặc test có sẵn bắt được; hoặc việc một lần, dễ làm lại (dịch, sync docs). | Low (cơ học) / Medium (có code) |
| Sai âm thầm: Số tiền, ghi DB, quyền ghi (write permissions), công thức tính toán; test đếm dòng hay test cơ bản không bắt được. | High |
| Đang tranh cãi một kết quả tiền cụ thể: Cần một lượt đào sâu để phân xử (red-team, review verdict holdout). Chỉ dùng cho review/audit, không bao giờ dùng cho cook! | Extra High (Review only) |
| Bài toán đơn lẻ cực khó: Chấp nhận chờ lâu để giữ nguyên 1 chuỗi suy luận duy nhất (1 agent). | Max |
💡 Câu hỏi để quyết định Effort:
“Sai thì ai bắt, và bắt lúc nào?”
Bạn bắt lúc test tay trên màn hình → Medium đã đủ. Không ai bắt cho tới khi báo giá / hóa đơn đã gửi đến khách hàng → Bắt buộc High.
Ghép lại: 4 góc phối hợp & Cảnh báo Phản mẫu (Anti-Patterns)
Tier trả lời “ai làm”, Effort trả lời “kỹ tới đâu”. Bốn góc phối hợp chuẩn trong thực chiến:
Luna + Low / Medium
Cơ học: Chạy test suite, reindex, sync docs, dịch tài liệu UAT.
Terra + Medium
Cook có spec rõ, sai thấy ngay trên màn hình (Phase 10b, 11, 3, 7).
Terra + High
Cook có spec, phán đoán giới hạn, nhưng sai lặng lẽ trong logic ngầm (Phase 6).
Sol + High
Phán đoán mở và sai âm thầm (Phase 12, 13, 5B, 9, 14).
Lưu ý: Sol Medium phù hợp khi phán đoán mở nhưng sai thấy ngay (ví dụ 10a; hoặc khi bạn đang sẵn phiên Sol thì dùng tiếp cho Phase 11 vẫn hoàn toàn đúng).
⚠️ Cảnh báo Phản mẫu (Anti-patterns):
Không có ô nào hợp lý cho Sol Low hay Luna High: Tier cao mà không kiểm chứng (Sol Low) là lãng phí tài nguyên; Tier thấp mà ép suy nghĩ lâu (Luna High) thì dù có nghĩ thêm vẫn thiếu năng lực phán đoán mở và thiếu hiểu biết ngữ cảnh sâu.
Giải mã cú pháp: “Terra Medium (Sol Medium)”
Quy ước cú pháp: [Lựa chọn đề xuất tối ưu] ([Lựa chọn thay thế chấp nhận được]).
Tại sao Sol > Terra > Luna nhưng bảng lại khuyên dùng Terra Medium? Vì bảng không chọn “mạnh nhất” mà chọn “đủ cho việc đó”. Với việc cả 3 câu hỏi đều “không” (spec kê sẵn file:line, sai thấy trên màn hình), Terra Medium làm tốt ngang Sol Medium mà rẻ hơn nhiều. Sol Medium trong ngoặc nghĩa là nếu bạn đang mở sẵn session Sol thì dùng luôn cũng đúng, không cần tốn công chuyển đổi.
Tại sao không chọn Terra High (Sol Medium)? Vì Effort High không làm Terra thông minh bằng Sol; High chỉ khiến Terra quét toàn repo thừa thãi (“quét cả repo cho một sửa nhỏ”) và overthink tốn token. Terra High (Sol Medium) chỉ đúng khi phần khó là kiểm chứng cẩn thận chứ không phải phán đoán mở.
03Bốn vai chính (The Four Roles)
Coi roster là một team kỹ thuật hoàn chỉnh, không phải bảng xếp hạng đơn tuyến. Model đắt nằm ở đầu workflow — không phải mọi commit.
Fable 5
Nằm ở đầu workflow. Suy nghĩ bài toán, challenge requirement, thiết kế domain, system architecture, UX flow và novel UI.
GPT-5.6 Sol
Kỹ sư chủ lực giải quyết engineering khó: backend API, DB, auth, concurrency, audit, security, debug lỗi phức tạp và E2E testing.
GPT-5.6 Luna
Thực thi công việc hằng ngày khi task đã rõ ràng và có PLAN.md: CRUD, form, boilerplate, test case lặp lại, rename, CSS spacing.
GPT-5.6 Terra
Thám tử điều tra khi chưa biết bug nằm ở đâu hoặc cần reverse engineer một repo lạ; lần theo dependency broad tracing trước khi Sol code.
04Bộ định tuyến task (Interactive Wizard)
Chọn đặc điểm task bên dưới để nhận model và effort level khuyến nghị ngay tức thì:
05Routing mình khuyên dùng hằng ngày
Nếu chỉ nhớ một sơ đồ, hãy nhớ quy trình này: Spec chưa rõ thì để Fable nghĩ; sau đó tách theo mức độ ảnh hưởng (Luna vs Sol); qua Tests và Sol Review; chỉ Fable second-opinion với thay đổi trọng yếu.
06Khi không biết code nằm đâu
Đừng implement vội khi chưa hiểu hệ thống. Hãy để Terra làm thám tử điều tra và lập bản đồ trước, sau đó Sol implement.
Chưa xác định được vị trí file hoặc luồng dữ liệu
Broad dependency tracing, reverse engineering flow, xác định blast radius
Danh sách chính xác các module và điểm cần chỉnh sửa
Viết code an toàn, test và hoàn thiện
07Bảng task tổng hợp (30 Tasks)
Bảng định tuyến thực dụng từ kinh nghiệm thực chiến. Hàng gắn ★ là điểm có đồng thuận cộng đồng cao nhất.
| Tác vụ | Model tốt nhất | Effort | Backup / Reviewer |
|---|
08Phân loại 4 Cấp độ & Ví dụ Thực tế
Tra cứu các mẫu prompt thực chiến và model khuyến nghị theo 4 cấp độ phức tạp:
| Công việc | Prompt ví dụ | Model | Effort |
|---|
09Phòng tránh Overthinking & Overengineering
Hiểu đúng về cái giá của Reasoning cao: AI suy nghĩ quá nhiều có thể tự sáng tạo thêm rào cản và giải quyết các bài toán chưa hề tồn tại.
Medium: Thiết kế sạch & Thực tế
Đáp ứng đúng bài toán CRUD API: Controller ➔ Service ➔ Repository ➔ Database. Gọn gàng, dễ test, bảo trì nhanh.
Max có nguy cơ đề xuất (Overengineering)
CQRS + Kafka + EventBus + Distributed Cache + Saga Orchestrator + Audit Service cho một ứng dụng nội bộ 50 người dùng.
| Mức Reasoning | ✅ Lợi ích thực tế | ⚠️ Rủi ro Overengineering |
|---|---|---|
| Reasoning Cao (High / Max) | Thử nhiều hướng, tự kiểm tra lỗi, tìm edge case ẩn, cân nhắc bảo mật và trade-off toàn diện. | Thiết kế quá phức tạp, thêm abstraction thừa, tối ưu hóa quá sớm, giải quyết bài toán chưa tồn tại. |
| Reasoning Vừa (Medium ⭐) | Tập trung đúng phạm vi, sinh code sạch, thời gian trả lời nhanh, tiết kiệm quota và chi phí. | Có thể bỏ sót một vài edge case hiếm nếu prompt không nêu rõ ràng. |
10Quy trình làm việc khuyến nghị (Multi-round Workflow)
Làm việc theo nhiều vòng lặp nhỏ (Draft ➔ Refine ➔ Review ➔ Challenge) luôn vượt trội so với cố gắng bắt AI tạo \"lời giải hoàn hảo tuyệt đối\" ngay từ prompt đầu tiên:
11Rule of Thumb: Chọn Effort theo câu mở đầu Prompt
Nếu chưa biết chọn mức effort nào, hãy nhìn vào động từ mở đầu trong câu lệnh của bạn:
| Nếu Prompt bắt đầu bằng… | Effort khuyến nghị | Ví dụ minh họa |
|---|---|---|
| "Làm giúp tôi…" | Light / Medium | Viết email, viết code CRUD, tạo REST API, viết SQL query |
| "Thiết kế giúp tôi…" | Medium ⭐ | Database schema, API contracts, workflow state machine, dashboard KPI |
| "So sánh và chọn…" | High | PostgreSQL vs MongoDB? Kafka vs RabbitMQ? Sol vs Fable cho module này? |
| "Đánh giá / Review…" | High | Review pull request, review kiến trúc microservice, kiểm toán query chậm |
| "Review code vừa viết…" | High | Cùng session, vài file → High. Auth/tiền/migration → Extra High. Săn mọi lỗ hổng → Max. |
| "Review plan nhiều file / phase…" | High | Thứ tự, file đụng, phụ thuộc → High. Coupling ẩn → Extra High. Nhánh độc lập → Ultra. |
| "Business logic / domain…" | Medium / High | Đã biết file → Medium. Rule rải nhiều module → High. Đổi policy tiền/quyền → Extra High. |
| "Đã đủ context để tiếp tục?…" | Medium ⭐ | Checklist đã biết / còn thiếu. Chưa biết data nằm đâu → Terra Medium trước. |
| "Tìm mọi rủi ro / edge cases…" | Max | Security audit, scalability bottleneck, race condition trong distributed system |
| "Đóng vai Principal Architect / CTO…" | Max | Audit toàn bộ hệ thống, challenge mọi assumption, phản biện kiến trúc trước khi release |
12Fable 5 — Kiến trúc / Product / Designer
Đặt Fable 5 ở đầu workflow, không nhất thiết để nó viết toàn bộ code. Một developer 10+ năm kinh nghiệm chia sẻ: Fable vượt trội ở khả năng quy hoạch, UI taste, chủ động phản biện các yêu cầu vô lý và thiết kế hướng tới khả năng scale dài hạn.
Ví dụ: Đi một tính năng mới
"Thêm tính năng AI quotation vào hệ thống quản lý sản xuất nội thất."
Route ngay tới Fable 5 High để thực hiện: hiểu business context → challenge requirements → tìm edge cases bị thiếu → domain model & DB schema → workflow state machine → UX flow → spec implementation plan.
13GPT-5.6 Sol — Senior Implementation Engineer / Auditor
Nếu Fable là kiến trúc sư thì Sol là kỹ sư trưởng chịu trách nhiệm phần implementation khó và kiểm toán chất lượng. Sol có hiệu suất token tốt nhất và khả năng phân tích focused code review vượt trội.
Backend & Infrastructure
Service layer, API contracts, DB query optimization, concurrency, caching, message queues, deployment configs.
High Blast-Radius Code
Authentication, RBAC permissions, payment gateway, DB schema migrations, security checks, shared core libraries.
Sol là gì (OpenAI, 2026)
- Flagship GPT-5.6 — Codex gọi là frontier agentic coding model. Alias API
gpt-5.6trỏ tớigpt-5.6-sol. - Context 1,050,000 token, output tối đa 128,000. Knowledge cutoff 16 Feb 2026. API default effort =
medium. - Giá promo API: $4 / $20 mỗi 1M token (input/output) ít nhất đến 21 Nov 2026. Cached input $0.40.
- Chọn Sol khi việc mở, khó, hoặc cần phán đoán/polish. Việc hẹp, lặp lại: Terra hoặc Luna.
Thang Effort của GPT-5.6 Sol
Effort là lượng suy luận của một agent. Ultra không nằm trên thang đó — Ultra đổi cách chạy thành nhiều agent song song. Codex CLI ghi Low; ChatGPT desktop / IDE ghi Light; API ghi low.
| Bề mặt | Light | Medium | High | Extra High | Max | Ultra |
|---|---|---|---|---|---|---|
| Codex CLI | Low | Medium | High | Extra High | Max | More reasoning… |
| ChatGPT / IDE | Light | Medium | High | Extra High | Max | Ultra |
API reasoning.effort |
low |
medium |
high |
xhigh |
max |
Không phải effort — multi-agent mode |
Max ≠ Ultra
Max cho một agent nghĩ lâu hơn trên một bài không tách được. Ultra chia việc cho vài agent chạy song song rồi ghép kết quả. Plan 5 phase dùng chung một domain model → Max hoặc Extra High. Plan tách được backend / frontend / migration độc lập → Ultra. Hầu hết task không cần cả hai.
Cổng context — “AI đã đủ context chưa?”
Đây là checklist, không phải thiết kế hệ thống. Dùng Sol Medium (hoặc Terra Medium nếu chưa biết data nằm đâu). Kết quả phải là: đã biết / còn thiếu / được phép code tiếp hay phải đọc thêm. Đừng nhảy Extra High/Max — sẽ overthink và đốt quota trước khi implement.
Task thực chiến → Effort Sol
Bảng cho đúng những việc hay hỏi: review code vừa xong, review plan nhiều file/phase, hỏi business logic, và tự kiểm xem đã đủ context để tiếp tục.
| Tác vụ | Effort | Vì sao mức này | Đừng nâng lên |
|---|
14GPT-5.6 Luna — Worker / Daily Driver
Đừng lãng phí Fable hay Sol vào các tác vụ cơ học: đổi button, thêm field, rename variable, CSS spacing, CRUD, mapping DTO, viết unit test lặp lại. Luna là lựa chọn kinh tế nhất khi task đã bounded.
15GPT-5.6 Terra — Explorer / Detective
Terra không dùng để làm default implementation model. Terra phát huy sức mạnh tối đa khi cần "truy vết diện rộng" (broad tracing) qua nhiều package/subsystem, phân tích ảnh hưởng khi chưa hiểu mã nguồn.
16E2E Browser Testing & Browser Automation
Với kiểm thử trình duyệt đầu-cuối (Playwright, Cypress, Browser agent), GPT-5.6 Sol là model chủ lực.
E2E browser testing đòi hỏi agent phải liên kết và tương quan chuỗi dữ liệu đa tầng:
| Tác vụ E2E / Browser Automation | Model khuyến nghị | Effort |
|---|
Quy trình E2E hằng ngày (Everyday Workflow)
17Khi Fable 5 hết quota — Fallback Strategy
Khi Fable 5 chạm mốc 0 quota, không có một model thay thế hoàn hảo duy nhất. Cách tiếp cận đúng là phân nhánh theo 3 trụ cột:
Brainstorm, PRD, challenge requirement, system architecture.
Thiết kế UI/UX mới, concept, layout cần taste thẩm mỹ cao (Native Vision).
Backend, API, DB migrations, security, deep debug.
Ma trận Fallback chi tiết (19 Tasks)
| Task (thường giao Fable 5) | Fallback tốt nhất (1st) | Lựa chọn 2 (2nd) | Lựa chọn 3 (3rd) |
|---|
18So sánh 7 model thay thế Fable & Benchmarks
Đánh giá khách quan dựa trên chỉ số Artificial Analysis Index, AA-Briefcase, DeepSWE, TerminalBench 2.1 & 3, và AutomationBench:
| Model | AA Intelligence Index | So với Fable 5 | Đánh giá & Vai trò |
|---|---|---|---|
| Claude Fable 5 Max | 62 | 100% (Mốc tham chiếu) | 🥇 Frontier Architect & UI Taste |
| Kimi K3 Max (2.8T) | 60 | Cực kỳ sát (95%) | ⭐⭐⭐⭐⭐ Gần Fable nhất (Native Vision, AA-Briefcase 1540) |
| GLM-5.3 Max (753B) | 60 | Cực kỳ sát (95%) | ⭐⭐⭐⭐⭐ Đối trọng kinh tế số 1 ($56 Pro, Claude Code) |
| Qwen3.8 2.4T / Max | 58 | Rất gần (90%) | ⭐⭐⭐⭐½ Rất mạnh UI & Frontend ($2/$6 API) |
| DeepSeek V4 Pro (1.6T) | 53 | Có khoảng cách | ⭐⭐⭐⭐ Senior Implementation Worker (MIT, $0.435) |
| DeepSeek V4 Flash (284B) | 52 | Worker thuần túy | ⭐⭐⭐½ Sub-agent & Worker giá siêu rẻ ($0.14/1M) |
Claude Opus 5 9.0/10
Gần Fable nhất ở reasoning: Xuất sắc ở deep planning và agentic coordination. Giá rẻ bằng 1/2 Fable.
Lưu ý: Đôi khi quá tự tin khi đưa ra kết luận chưa trọn vẹn, cần Sol review code kỹ.
GPT-5.6 Sol 9.5/10 (Eng)
Kỹ sư số 1: Mạnh nhất cho backend, DB, migrations, audit, security và multi-file refactoring (Dẫn đầu DeepSWE 72.7 & TerminalBench 3: 34.6).
Điểm yếu: Thiếu "taste" thẩm mỹ tự nhiên ở novel UI; không nên lạm dụng Sol Ultra.
Kimi K3 Max 9.5/10 (UI/Arch)
Đỉnh cao UI & Vision (2.8T MoE): AA Index 60 (sát Fable 62). Dẫn đầu AA-Briefcase (1540 - vượt Sol 1504). Đạt 90–95% năng lực Fable.
Native Vision: Cho phép gửi trực tiếp Mockup + UI code + Screenshot browser để tự lặp trực quan.
GLM-5.3 Max 9.0/10 (Value)
Kỳ đài Agentic Coding ($56 Pro): AA Index 60, dẫn đầu AutomationBench (48.2), tích hợp chính thức Claude Code với hơn 20 tools.
Kinh tế vượt trội: Gói GLM Coding Pro ($56 promo) cung cấp 6x quota, là đối trọng kinh tế số 1 của ChatGPT Pro $100.
Qwen3.8 2.4T / Max 8.5/10
Open Weights 2.4T / Qwen3.8-Max: AA Index 58. Rất mạnh ở UI/frontend và product layouts với giá API siêu rẻ ($2/$6).
DeepSeek V4 Pro 9.0/10 (Worker)
V4 Pro 1.6T (MIT License): AA Index 53. Giá $0.435/$0.87. Hoàn hảo cho Senior Implementation Worker (backend/API/DB).
DeepSeek V4 Flash 9.8/10 (Cost)
V4 Flash 284B ($0.14/$0.28): Model worker/subagent siêu tiết kiệm cho tác vụ lặp lại hàng loạt.
| Benchmark (Thực chiến) | GLM 5.3 | Kimi K3 | DeepSeek V4 | Qwen 3.8 | Fable 5 | Sol 5.6 |
|---|---|---|---|---|---|---|
| TerminalBench 2.1 | 88.2 | 88.3 | 87.9 | 86.6 | 88.0 | 88.8 |
| DeepSWE 1.1 | 66.9 | 67.5 | 62.7 | 56.6 | 69.7 | 72.7 |
| AutomationBench (Agent) | 48.2 | 46.7 | 43.2 | 39.8 | 46.2 | 45.8 |
| TerminalBench 3 (Hard) | 28.3 | 17.4 | — | — | 33.7 | 34.6 |
| AA-Briefcase (Knowledge Work) | — | 1540 | — | — | 1574 | 1504 |
19Phân loại 4 tầng & Thứ tự ưu tiên
Cấu trúc định tuyến mới phân bổ sức mạnh theo từng domain kỹ thuật cụ thể:
20Thực tế về Open-Weight: Kích thước & Giấy phép
Cần phân biệt rõ: Open-weight KHÔNG đồng nghĩa với local model có thể chạy trên máy bàn thông thường. Kimi K3 (2.8T), Qwen 3.8 (2.4T), DeepSeek V4 Pro (1.6T) là các mô hình quy mô Datacenter. Cách dùng thực tế hiệu quả nhất là qua inference API rẻ hoặc các gói Coding subscription (Claude Code / OpenCode / Kimi Code).
| Model | Tham số (Params) | Weights | Giấy phép (License) | Khả năng triển khai |
|---|
21Ba cấu hình chi phí ($300 vs $260–$290 vs Lean)
So sánh các phương án ngân sách thực tế cho senior full-stack developer:
Option A: Cặp đôi Frontier Đỉnh cao ($300/tháng)
Fable lo nghĩ/UI, Sol Medium làm coding mặc định, Sol High audit, Luna worker, Terra explore. Setup cân bằng, không lãng phí Fable.
Option B: 4 Family Powerhouse ($260–$290/tháng)
Fable High làm kiến trúc chính. Khi cạn quota: Kimi K3 Max làm architect fallback, GLM-5.3 Pro làm secondary engineer, DeepSeek V4 Pro/Flash làm worker.
Option C: Ultra-Lean Starter (~$260/tháng)
Tận dụng Fable/Opus trên Claude Max, GLM-5.3 cho coding nặng, DeepSeek cho worker. Chỉ bật Kimi K3 khi cần visual UI đặc thù.
22Bảng định tuyến AgentKit / Workflow (12 Tasks)
Bảng phân luồng chi tiết giữa Primary Model và Phương án Fallback khi Fable hết quota:
| AgentKit / Workflow Task | Primary Model | Fallback khi Fable hết Quota |
|---|
23Có nên bỏ thêm $100/tháng mua ChatGPT Pro 5x?
Lời khuyên thực tế nhất lúc này là: Đừng vội mua ngay.
Hãy dùng thử 1 tháng cấu hình: Claude Max 20x + GLM Coding Pro + DeepSeek API (với Kimi K3 làm Fable overflow). Nếu sự kết hợp này xử lý tốt codebase thực tế của bạn mà không tốn công điều chỉnh lặp lại, bạn hoàn toàn có thể tiết kiệm $100/tháng.
Nếu bạn liên tục nhận thấy GLM/Kimi giải quyết được 80–90% task nhưng Sol one-shot vượt trội ở 10–20% ca hóc búa nhất (như minh chứng từ TerminalBench 3: Sol 34.6 vs GLM 28.3 vs Kimi 17.4), thì lúc đó mua ChatGPT Pro 5x là hoàn toàn xứng đáng.
24Đừng dùng Ultra mặc định
Nghĩ nhiều hơn không đồng nghĩa luôn tốt hơn. Ultra không phải nấc trên Max — Ultra đổi cách chạy (nhiều agent), nên dễ scope-creep và đốt quota.
Quy tắc 1 dòng cho Sol
Context gate & implement theo plan → Medium. Review code vừa viết / plan nhiều phase / domain xuyên module → High. Auth-tiền-migration hoặc High thất bại → Extra High. Một phán quyết ship/no-ship → Max. Nhiều nhánh độc lập → Ultra.
25Workflow full-stack production (5 Phases)
Quy tắc ghi trong Plan & 3 câu hỏi cho từng Phase
Mỗi khi lập hoặc rà soát Phase trong PLAN.md, bắt buộc đánh giá qua 3 câu hỏi:
(1) Quyết định spec
Cook phải tự quyết điều spec không kê được?
(2) Sai âm thầm
Sai có âm thầm không (tiền, DB, quyền ghi, công thức)?
(3) Đọc rộng codebase
Phải đọc rộng nhiều module trước khi sửa?
📐 Quy tắc tính điểm & Routing:
Một “có” = High effort; Hai “có” trở lên = Tier cao nhất (Fable / Sol); Cả 3 “không” (no/no/no) = Terra Medium (hoặc Luna cho việc thuần cơ học).
🛡️ Các rào chắn an toàn (Safety Guardrails):
- Extra High và Max: KHÔNG BAO GIỜ dùng cho cook, chỉ dùng cho red-team hoặc review kết quả tiền đang tranh cãi. Dữ liệu thực nghiệm 5.5 cho thấy xhigh tụt performance dưới High khi làm agentic coding vì nghĩ quá nhiều / đi lạc; OpenAI cũng chỉ khuyến cáo dùng khi eval chứng minh có lợi.
- Ultra: Không dùng trên cây làm việc chung (tránh phân mảnh context và xung đột branch).
- Quy tắc DONE_WITH_CONCERNS: Nếu cùng một phase bị
DONE_WITH_CONCERNS2 lần liên tiếp → Tăng một bậc effort cùng tier, hoặc lấy ý kiến đối chiếu từ hãng kia (Claude ↔ GPT); tuyệt đối không tùy tiện nhảy tier. - Gatekeeper: Fable vẫn giữ vai trò Gate chốt plan và kiến trúc ở phiên này.
Bảng gợi ý Routing 13 Phase thực chiến
| Phase | Nhiệm vụ cụ thể (Việc còn lại) | Q1 / Q2 / Q3 | Claude | GPT |
|---|---|---|---|---|
| Phase 3 | vision re-rank | no / no / no | Opus Medium | Terra Medium (Sol Med) |
| Phase 10b | fold, ngăn Nguồn, hero dedupe, R4.8c | no / no / no | Opus Medium | Terra Medium (Sol Med) |
| Phase 11 | chat front door (đang chạy Sol Medium, đúng) | no / no / no | Opus Medium | Sol Medium (Terra Med) |
| Phase 12 | 24 tháng + fallback, null-date, money key, verdict | yes / yes / yes | Fable High | Sol High |
| Phase 12 verdict | quyết milestone B (đọc verdict) | yes / yes / no | Fable High | Sol High (1 lượt xhigh chỉ khi tranh cãi) |
| Phase 13 | formula review, report only | yes / yes / yes | Fable High | Sol High + ý kiến hãng kia |
| Phase 14 | Builder 3 khối theo vai | yes / no / partly | Fable High (Opus High nếu kê mockup trước) | Sol High (Terra High với mockup) |
| Phase 5B (hoãn) | trợ lý tác động lên Builder | yes / yes / yes | Fable High | Sol High |
| Phase 6 (hoãn) | composition, mở rộng loại | yes / no / yes | Opus High | Terra High (Sol Med) |
| Phase 7 (hoãn) | loại đơn variants | no / no / no | Opus Medium | Terra Medium |
| Phase 9 (parked) | CAD/vision điền template | yes / yes / yes | Fable High | Sol High |
| Việc cơ học | chạy suite, reindex, sync docs/features, dịch UAT | no / no / no | Opus Low | Luna Medium |
| Plan work | debate, red-team, gate | yes / yes / yes | Fable High | Sol High (Grok xhigh làm tiếng nói ngoài) |
Ghi chú Chi phí & Benchmark (Artificial Analysis)
Theo dữ liệu Artificial Analysis: Sol Max bám sát Fable trong khoảng 1 điểm năng lực với mức chi phí chỉ bằng khoảng một nửa. Do đó, cột GPT là lựa chọn mặc định tiết kiệm chi phí khi hai bên ngang nhau; cột Claude ưu tiên khi phase chạm vào lịch sử quyết định cốt lõi của plan mà controller đang nắm giữ.
26Bảng vai (Roster Summary)
Cấu hình khuyến nghị hoàn chỉnh cho senior full-stack engineer: