29/07/2026
TÔI TRẢ 200$ CHO CLAUDE — NHƯNG KHI MỌI THỨ RỐI TUNG, CODEX “MIỄN PHÍ” LẠI LÀ ĐỨA Ở LẠI DỌN CHIẾN TRƯỜNG
11 giờ đêm.
Gói Claude Max 200$ của tôi vẫn còn đó.
Nhưng trước mặt tôi là những phiên chat trắng xóa.
Có phiên báo “Session history unavailable”. Có phiên vẫn còn tên nhưng mở ra không còn nội dung. Có phiên vừa làm việc hôm trước, hôm sau đã mất mạch dữ liệu gần nhất.
Một việc tưởng chỉ là gom lại các folder, quy hoạch đường dẫn và tạo một nơi làm việc tập trung đã kéo dài suốt hai ngày. Càng làm càng sinh thêm lỗi. Link cũ hỏng. Đường dẫn mới lệch. Có thứ được thông báo “đã sửa”, nhưng kiểm lại mới phát hiện mã vẫn nằm nguyên tại chỗ.
Tôi ngồi nhìn màn hình và bỗng tự hỏi:
MÌNH ĐANG DÙNG AI ĐỂ GIẢM VIỆC — HAY ĐANG BỎ TIỀN ĐỂ LÀM QUẢN LÝ, KIỂM THỬ VIÊN VÀ NGƯỜI DỌN HẬU QUẢ CHO AI?
Điều trớ trêu nhất là ở cửa sổ bên cạnh, Codex — công cụ tôi mới sử dụng gần một tháng, ban đầu chỉ thử vì đang được cấp nhiều token khuyến mại — lại đang lần theo từng file, kiểm lại từng lời khẳng định và tìm ra những lỗi mà trước đó chưa ai nhìn thấy.
Tôi không viết bài này để biến Codex thành một “vị thần AI” mới.
Tôi viết vì có lẽ rất nhiều người đang mắc kẹt trong đúng vòng lặp của tôi:
Nghe người khác nói một AI nào đó thông minh nhất.
Trả tiền cho gói cao nhất.
Đưa vào đó hàng đống luật, prompt, bộ nhớ và skill.
Rồi cuối cùng phát hiện ra rằng người mệt nhất trong cả hệ thống vẫn là chính mình.
◾ HÀNH TRÌNH CỦA TÔI KHÔNG BẮT ĐẦU TỪ CLAUDE
Tôi sử dụng ChatGPT từ những ngày đầu tiên nó xuất hiện.
Khoảng hai năm đầu, ChatGPT giống như một cánh cửa vừa được mở ra.
Những việc trước đây phải hỏi người khác, tìm Google, đọc hàng chục trang tài liệu, giờ có thể bắt đầu chỉ bằng một ô chat.
Tôi dùng ChatGPT rất nhiều.
Nhưng sau khoảng hai năm, tôi dần sử dụng ít đi. Không hẳn vì ChatGPT đột nhiên trở nên tệ, mà vì công việc của tôi lớn hơn, kỳ vọng cao hơn và thị trường bắt đầu xuất hiện thêm nhiều lựa chọn mới.
Sau đó tôi dùng Gemini khoảng một năm.
Thời gian đầu Gemini cũng khiến tôi rất hào hứng.
Nó có nhiều tính năng mới, được sử dụng Gems miễn phí, kết nối với hệ sinh thái Google thuận tiện. Khả năng tạo ảnh có những lúc khiến tôi cảm thấy tốt hơn công cụ mình đang sử dụng.
Tôi lại có cảm giác mình vừa tìm được một cánh cửa mới.
Rồi trong quá trình tham gia các khóa học về AI, tôi bắt đầu nghe nhắc rất nhiều đến Claude.
Claude được giới thiệu như một AI gần như “thần thánh”:
Viết tự nhiên.
Hiểu sâu.
Khả năng lập trình vượt trội.
Có thể đọc lượng context lớn.
Làm tool nhanh.
Và đặc biệt, Claude thường được nhắc tới như một lựa chọn rất mạnh dành cho người viết code và xây sản phẩm.
Tôi bắt đầu thử Claude để tạo một số tool nhỏ trong thời gian học.
Với những dự án nhỏ và yêu cầu đơn giản, phải công nhận Claude làm rất tốt. Nó trả lời mạch lạc, làm nhanh và tạo ra cảm giác rằng nó thực sự hiểu điều mình muốn.
Có giai đoạn tôi dùng Claude ít đi.
Nhưng sau đó, khi trên những cộng đồng tôi theo dõi xuất hiện làn sóng chỉ trích ChatGPT và nhiều người chuyển sang Claude, tôi bắt đầu sử dụng Claude nhiều hơn.
Tính cả thời gian thử nghiệm và sử dụng, tôi đã đi cùng Claude khoảng một năm hai tháng.
Sáu tháng gần đây là thời gian tôi dùng Claude nhiều nhất và bắt đầu trả phí từ Pro lên Max.
Tôi không chỉ mua một gói AI.
Tôi đã gửi vào đó dự án, thời gian, thói quen làm việc, dữ liệu và niềm tin rằng:
Nếu mình trả phí cao hơn, viết luật kỹ hơn, xây bộ nhớ tốt hơn, AI sẽ làm việc ổn định hơn.
Nhưng rồi những dự án của tôi không còn là vài chiếc tool đơn giản.
Chúng bắt đầu có nhiều nhánh, nhiều phiên, nhiều file, nhiều repo, nhiều đường dẫn và rất nhiều quyết định cũ không được phép nhầm.
Và đó là lúc tuần trăng mật kết thúc.
◾ CLAUDE KHÔNG BỖNG NHIÊN TRỞ THÀNH AI TỆ
Điều thay đổi là công việc của tôi đã vượt khỏi vùng mà trước đây Claude từng khiến tôi kinh ngạc.
Với một nhiệm vụ nhỏ, một câu trả lời thông minh có thể khiến chúng ta nghĩ AI rất giỏi.
Nhưng với một dự án lớn, thông minh thôi chưa đủ.
Sự thông minh chỉ có giá trị khi đi cùng bốn điều:
NHỚ ĐÚNG.
LÀM ĐÚNG.
KIỂM ĐÚNG.
VÀ BÁO ĐÚNG.
Tôi bắt đầu gặp những tình huống rất quen:
Claude nói đã sửa, nhưng chuỗi thay thế thực tế không khớp nên mã vẫn nằm nguyên.
Claude nói đã kiểm, nhưng chỉ kiểm xem một dòng chữ có tồn tại, chưa hề chạy hành vi thật.
Claude nói “xong”, nhưng đường dẫn mới còn chưa tồn tại.
Claude sửa một lỗi rồi vô tình mở ra một lỗi khác.
Tôi đã viết hàng đống luật, bộ nhớ, skill và quy định “chắc như đinh đóng cột”, vậy mà ngay trong một phiên chat chưa đầy context, nó vẫn có thể nói trước quên sau.
Gói Max 200$ vẫn có thể chạm giới hạn đúng lúc công việc đang căng nhất.
Nhưng điều khiến tôi mệt nhất không phải một lỗi code.
Mệt nhất là MÓN NỢ NIỀM TIN.
Khi AI nói “đã xong”, tôi không còn biết nên tin hay phải kiểm lại toàn bộ.
Nếu tôi phải tự kiểm từ đầu đến cuối, AI còn tiết kiệm cho tôi được bao nhiêu thời gian?
Nếu tôi không kiểm, tôi có thể trả giá bằng dữ liệu, đường dẫn, lịch sử công việc và nhiều ngày sửa hậu quả.
Một công cụ khiến chủ dự án luôn sống trong trạng thái “không biết lời nào của nó là thật” thì dù văn phong có hay đến đâu, trải nghiệm làm việc cũng dần biến từ sung sướng thành căng thẳng.
◾ RỒI TÔI MỞ CODEX — VÀ BAN ĐẦU CŨNG KHÔNG CÓ PHÉP MÀU NÀO CẢ
Tôi bắt đầu thử Codex gần một tháng trở lại đây.
Phải nói cho công bằng: một đến hai tuần đầu, Codex cũng không làm tôi hoàn toàn hài lòng.
Tôi đang chuyển sang một ngôi nhà mới nhưng lại đưa cho nó quá ít hành lý.
Tôi chưa truyền đầy đủ luật.
Chưa đưa hết các skill.
Chưa trao cho nó toàn bộ lịch sử và cách làm việc mà tôi đã mất nhiều tháng xây dựng bên Claude.
Tôi vẫn dùng những câu hỏi giống bên Claude rồi chờ Codex phải lập tức cho kết quả vượt trội.
Có việc Codex làm được.
Có việc Codex làm chưa tốt.
Nhưng Claude liên tục chạm giới hạn sử dụng hàng tuần, trong khi Codex ở giai đoạn tôi trải nghiệm lại cho lượng token khuyến mại khá rộng.
Tôi buộc phải giao cho Codex nhiều công việc thật hơn.
Và chính khi tôi ngừng “hỏi thử” để bắt đầu “giao việc thật”, tôi nhìn thấy sự khác biệt.
Vẫn cùng một yêu cầu, có những việc Claude loay hoay qua nhiều vòng nhưng Codex đi thẳng vào file, đo trạng thái, chỉ ra mâu thuẫn và hoàn thành nhanh hơn.
Codex không phải lúc nào cũng đúng.
Điều khiến tôi thay đổi thái độ là:
KHI BỊ YÊU CẦU PHẢI CHỨNG MINH, CODEX CÓ KHẢ NĂNG CHUYỂN CUỘC TRANH LUẬN TỪ LỜI NÓI SANG VẬT CHỨNG.
File nào thực sự tồn tại?
SHA nào đang chạy?
Test nào phải đỏ trước khi sửa?
Test nào xanh sau khi sửa?
Đường dẫn nào đã bấm được bằng trình duyệt thật?
Lỗi thuộc về code, thuộc về quy trình hay chỉ là một lời khẳng định chưa được kiểm chứng?
Những câu hỏi đó nghe không “thần thánh”.
Nhưng với một người đang xây dự án thật, nó quý hơn rất nhiều câu trả lời trôi chảy.
◾ HAI NGÀY VỪA RỒI LÀ LÚC CHIẾC MẶT NẠ RƠI XUỐNG
Tôi chỉ muốn thực hiện một việc nghe rất đơn giản:
Quy hoạch lại hệ thống folder đang nằm rải rác.
Tạo một nơi làm việc tập trung, sạch và rõ ràng.
Để sau này không xóa nhầm.
Không làm nhầm repo.
Không để các phiên AI cũ và mới ghi dữ liệu đá nhau.
Nhưng càng làm, sự việc càng rối.
Claude báo đã sửa những lỗi mà Codex chỉ ra.
Codex kiểm lại và phát hiện có chỗ chưa được sửa thật.
Claude đo lại và thừa nhận.
Claude viết test.
Codex phản biện rằng test đó mới chỉ dò chữ, chưa chứng minh hành vi thật.
Claude lại kiểm tra và thừa nhận.
Rồi link cục bộ hỏng.
Rồi đường dẫn sau khi di chuyển bị lệch một tầng.
Rồi có runner báo thành công mặc dù lệnh bên trong có thể đã thất bại.
Rồi xuất hiện cơ chế dọn phiên cũ khiến tôi hoảng sợ khi thấy nhiều lịch sử chat trắng đi.
Tôi nhìn hai AI chuyển thư qua lại. Mỗi vòng lại lòi thêm một vài vấn đề.
Và tôi nổi giận.
Không phải vì tôi ghét AI.
Tôi nổi giận vì sau hàng tháng bỏ tiền, bỏ thời gian, viết luật và đặt kỳ vọng, tôi vẫn phải là người đầu tiên bấm vào chiếc link chết để chứng minh hệ thống chưa ổn.
Trong những ảnh chụp tôi đăng kèm bài này, Claude đã nhiều lần thừa nhận rất cụ thể:
Codex đúng ở những lỗi nào.
Claude đã báo sửa nhưng thực tế chưa sửa ở đâu.
Vì sao một bộ test “xanh” vẫn chưa chứng minh được hệ thống thực sự an toàn.
Đây không phải bằng chứng rằng Claude thua Codex trong tất cả nhiệm vụ.
Claude vẫn có những việc làm tốt hơn.
Nhưng trong trận đánh cụ thể của tôi — một trận đòi hỏi kiểm tra filesystem, Git, đường dẫn, test hành vi và sự trung thực về trạng thái — Codex đã nhìn thấy nhiều thứ mà Claude bỏ sót.
Và đó là lúc tôi phải tự hỏi:
TÔI ĐANG TRUNG THÀNH VỚI CÔNG CỤ TỐT NHẤT CHO CÔNG VIỆC — HAY ĐANG TRUNG THÀNH VỚI HÌNH ẢNH “CLAUDE THÔNG MINH NHẤT” MÀ MÌNH ĐÃ NGHE QUÁ LÂU?
◾ CUỘC CHIẾN THẬT KHÔNG PHẢI CLAUDE ĐẤU CODEX
Cuộc chiến thật là:
AI nói hay đối đầu với AI chịu chứng minh.
Cảm giác thông minh đối đầu với kết quả có thể kiểm tra.
Một bản demo đẹp đối đầu với một hệ thống vẫn sống khỏe sau hàng trăm ngày.
Tôi vẫn công nhận Claude có rất nhiều điểm mạnh.
Có việc Claude viết rất hay.
Diễn đạt tự nhiên.
Lên ý tưởng nhanh.
Dựng những bản đầu khiến tôi bất ngờ.
Những trải nghiệm tốt trước đây của tôi với Claude đều là thật.
Nhưng việc trả 200$ không có nghĩa tôi phải nhắm mắt bảo vệ một công cụ khi nó không còn phù hợp với một số loại công việc.
Và việc Codex đang được tôi sử dụng bằng token khuyến mại không có nghĩa kết quả tốt của nó chỉ là ăn may.
Tiền là một dữ kiện.
Logo là một dữ kiện.
Danh tiếng là một dữ kiện.
Nhưng thứ tôi thực sự cần mua là:
SỐ GIỜ CUỘC ĐỜI ĐƯỢC TRẢ LẠI.
SỰ YÊN TÂM KHI GIAO VIỆC.
VÀ KHẢ NĂNG DỰ ÁN TIẾN LÊN MÀ KHÔNG ĐỂ LẠI MỘT BÃI RÁC PHÍA SAU.
Nếu một công cụ đắt hơn khiến tôi mất thêm nhiều giờ kiểm tra, còn một công cụ đang được dùng miễn phí giúp tôi tìm đúng lỗi và thu dọn nhanh hơn, tôi không có nghĩa vụ phải chọn công cụ đắt hơn chỉ để bảo vệ quyết định cũ của mình.
◾ VÌ SAO HIỆN TẠI TÔI CHỌN CODEX LÀM LỰC LƯỢNG CHÍNH?
Không phải vì Codex hoàn hảo.
Không phải vì OpenAI trả tiền cho tôi viết bài này.
Cũng không phải vì tôi muốn tạo thêm một cuộc chiến fanboy trên mạng xã hội.
Tôi chọn Codex nhiều hơn ở thời điểm hiện tại vì trong công việc thật của tôi, nó đang cho tôi ba thứ tôi cần:
Thứ nhất: BÁM VIỆC LÂU HƠN.
Khi nhiệm vụ khó và bẩn, tôi cần một AI chịu đi tiếp tới vật chứng, không chỉ đưa ra một kế hoạch đẹp.
Thứ hai: PHẢN BIỆN ĐƯỢC TRẠNG THÁI “ĐÃ XONG”.
Nó khiến tôi bắt đầu yêu cầu RED trước, GREEN sau, kiểm đường dẫn thật, chạy hành vi thật và tách rõ “đã đo được” với “đang suy đoán”.
Thứ ba: KHIẾN TÔI BỚT PHỤ THUỘC VÀO NIỀM TIN.
Tôi không cần tin lời AI nếu máy có thể chứng minh.
Đây cũng là bài học đau nhất của tôi sau hành trình từ ChatGPT, Gemini, Claude đến Codex:
AI TỐT NHẤT KHÔNG PHẢI LÀ AI LÀM BẠN KINH NGẠC TRONG 10 PHÚT ĐẦU.
AI TỐT NHẤT LÀ AI GIÚP BẠN VẪN CÒN KIỂM SOÁT ĐƯỢC DỰ ÁN SAU 100 NGÀY.
Tôi sẽ đăng kèm những ảnh chụp nguyên văn để mọi người tự đọc, không cần phải tin lời tôi.
Trong đó có cả lúc Claude làm tốt.
Lúc Claude thừa nhận Codex bắt đúng lỗi.
Lúc Codex chưa đủ tốt.
Và lúc chính tôi nổi nóng vì cả hai đã biến một đầu việc thành một mê cung.
Tôi không tuyên bố câu chuyện của mình là chân lý dành cho tất cả.
Đây chỉ là hóa đơn trải nghiệm của riêng tôi — được trả bằng tiền thật, dữ liệu thật, những đêm thật và rất nhiều giờ cuộc đời không thể lấy lại.
Nhưng nếu bạn cũng đang dùng AI mỗi ngày, tôi muốn để lại một câu hỏi:
AI GẦN NHẤT BẠN DÙNG ĐÃ THỰC SỰ TIẾT KIỆM CHO BẠN BAO NHIÊU GIỜ — VÀ ĐÃ ÂM THẦM LẤY LẠI BAO NHIÊU GIỜ ĐỂ SỬA LỖI, NHẮC VIỆC, KIỂM CHỨNG VÀ LÀM LẠI?
Đừng vội bình luận “Claude” hay “Codex”.
Hãy nói con số giờ bạn từng mất.
Vì có thể cuộc tranh luận lớn nhất của thời đại AI không phải mô hình nào thông minh hơn.
Mà là:
ĐẾN BAO GIỜ CON NGƯỜI MỚI NGỪNG TRẢ TIỀN ĐỂ LÀM BẢO MẪU CHO NHỮNG AI LUÔN NÓI RẰNG CHÚNG ĐÃ HIỂU?
TẬP 2:
Tôi sẽ công khai ảnh chụp Claude tự nhận Codex bắt đúng những lỗi nào, vì sao một bộ test xanh vẫn có thể nói dối, và bộ 7 câu hỏi tôi sẽ sử dụng từ nay để biết một AI “đã làm thật” hay chỉ đang kể một câu chuyện rất thuyết phục về việc nó đã làm.
Nếu bạn muốn đọc phần tiếp theo, hãy để lại đúng một từ:
“VẬT CHỨNG”.