An Tran Solutions
An Tran Solutions
Quay lại Blog

Cùng một mô hình, điểm nhảy từ 30% lên 100%: bạn đang mua nhầm nửa hệ thống AI

24 tháng 8, 202610 phút đọcbởi An Trần
Mục lục

Suốt hai năm, cách cả thị trường mua AI được gói gọn trong một câu hỏi: dùng mô hình nào? GPT hay Claude hay Gemini. Bảng xếp hạng ra mỗi tháng, ai đứng đầu thì người đó thắng, và mọi cuộc họp chọn nhà cung cấp đều xoay quanh cái tên đó.

Tuần trước có một con số làm câu hỏi ấy trông ngớ ngẩn.

Cùng một mô hình. Cùng một bài kiểm tra. Chạy trần: 30 điểm. Bọc trong một lớp phần mềm: 100 điểm. Không huấn luyện lại, không đổi model, không thêm dữ liệu.

Tiêu đề khắp nơi rút ra kết luận gọn ghẽ: lớp vỏ mới là anh hùng, mô hình chỉ là phụ. Kết luận đó đang bị đọc ngược. Và cách đọc ngược ấy sẽ khiến bạn mua sai lần nữa — chỉ là sai theo hướng mới.

Chuyện gì đã xảy ra ngày 21/8

Ngày 21/8/2026, NVIDIA công bố trên blog kỹ thuật chính thức rằng hệ thống agent của họ — AVO (Agentic Variation Operators), ra mắt từ cuối tháng 3/2026 — đạt điểm tuyệt đối 100,00 RHAE trên ARC-AGI-3.

Vài chữ cần dịch trước khi đi tiếp.

ARC-AGI-3 là bộ đo do ARC Prize Foundation phát hành ngày 25/3/2026. Khác với các bài kiểm tra hỏi–đáp thông thường, đây là bộ đo tương tác: AI bị thả vào những môi trường dạng game theo lượt, không có hướng dẫn, không có luật chơi, không có mục tiêu được nói ra. Nó phải tự khám phá cơ chế, tự đoán thế nào là thắng, và mang những gì học được sang màn sau. Con người giải được 100%. Theo công bố ra mắt của ARC Prize, các hệ thống AI tiên tiến nhất khi đó chấm dưới 1%.

Harness — tạm gọi là lớp vỏ vận hành — là toàn bộ phần mềm bao quanh mô hình: bộ công cụ nó được phép gọi, cách quản lý bộ nhớ, vòng lặp lập kế hoạch, và các quy tắc giám sát. Mô hình là động cơ; harness là phần còn lại của chiếc xe.

Kết quả cụ thể của NVIDIA:

Cấu hìnhKết quả
Claude Opus 5 chạy trần~30% (mức cao nhất trong các mô hình chạy trần)
VISTA + Claude Opus 5100,00 — 7.542 hành động
AVO + Claude Opus 5100,00 — 6.624 hành động (ít hơn ~12%)

AVO hoàn tất toàn bộ 183 màn thuộc 25 môi trường. Kiến trúc gồm ba phần: bộ nhớ bền vững mang theo kết quả và nhật ký từ các lần thử trước, một supervisor theo dõi toàn bộ hành trình để phát hiện khi agent giậm chân tại chỗ, và một vòng lặp quan sát – lập kế hoạch – thực thi – đánh giá.

Ông Adel El Hallak, Phó chủ tịch sản phẩm của NVIDIA, mô tả với TechCrunch rằng supervisor "gần như đóng vai một CEO, hích agent trở lại đúng hướng khi nó đi lệch".

Đó là phần tin tức. Giờ đến phần bị bỏ lại phía sau.

Ba dữ kiện khiến câu chuyện phải đọc lại

Thứ nhất: NVIDIA không phải người đầu tiên đạt 100.

Ngày 5/8/2026 — mười sáu ngày trước đó — một nhóm nghiên cứu tại MIT gồm Qiushi Han, Keya Hu, Linlu Qiu, Cathy Wu và Kaiming He đã công bố VISTA, và cũng đạt 100,00 trên đúng 25 game công khai đó, cũng với Claude Opus 5. GPT-5.6 Sol chạy trong cùng lớp vỏ đạt 98,27.

Nghĩa là đóng góp thật sự của AVO không phải "đạt 100". Nó là đạt 100 hiệu quả hơn 12%. Một tiến bộ kỹ thuật đáng ghi nhận — nhưng không phải cột mốc mà tiêu đề gợi ra.

Thứ hai: nhóm đạt 100 trước đó công khai phản bác cách diễn giải này.

Đây là chi tiết tôi thấy quan trọng nhất và gần như không ai trích. Chính các tác giả VISTA viết rằng "năng lực sẵn có của mô hình là yếu tố then chốt tạo nên thành công này", còn lớp vỏ của họ chỉ là "một cách đơn giản nhưng hiệu quả để khơi ra những năng lực đó". Họ nhấn mạnh VISTA được thiết kế tối giản, cố tình tránh kỹ thuật phức tạp.

Nói cách khác: nhóm dựng ra lớp vỏ đầu tiên đạt điểm tuyệt đối lại cho rằng công lớn thuộc về mô hình. Harness không tạo ra năng lực. Nó mở khóa năng lực vốn đã nằm sẵn ở đó.

Thứ ba: chính ARC Prize từ chối tính những điểm số này.

Theo chính sách kiểm định của ARC Prize, điểm chính thức được chấm khi mô hình chạy như một bộ dự đoán trực tiếp đầu vào → đầu ra, "không có agent harness và không có công cụ phía client". Mọi kết quả có lớp vỏ được đưa sang một bảng xếp hạng cộng đồng riêng, gắn nhãn rõ ràng.

Lý do không phải sự bảo thủ. Nó là định nghĩa: một hệ thống thật sự tổng quát thì không cần người ngoài dựng giàn giáo riêng cho từng loại bài toán.

Và bản thân NVIDIA cũng nói thẳng điều này trong bài công bố — phần mà hầu hết bản tin cắt bỏ: kết quả 100 điểm chỉ thuộc bộ công khai 25 môi trường, và "không phải kết quả trên bộ bán riêng tư hay bộ thi riêng tư hoàn toàn". Bộ đo được tách làm ba phần chính là để không ai có thể tối ưu riêng cho những bài mình sẽ bị chấm. Phần khó nhất vẫn chưa ai chạm tới.

Vậy điều gì thật sự đúng

Không phải "harness quan trọng hơn mô hình". Cũng không phải "mô hình vẫn là tất cả".

Điều đúng là: phương sai nằm ở lớp vỏ, còn trần năng lực nằm ở mô hình.

Mô hình quyết định bạn có thể đi xa đến đâu. Lớp vỏ quyết định bạn thực tế đi được bao xa. Khoảng cách 30 → 100 không phải phép màu của phần mềm bao quanh; đó là khoảng cách giữa năng lực một mô hình sở hữu và năng lực bạn moi được ra khỏi nó.

Điều này không phải phát hiện riêng của tuần trước. Tháng 5/2026, một nhóm nghiên cứu công bố bài báo với cái tên gần như một lời trách móc: Stop Comparing LLM Agents Without Disclosing the Harness — "Hãy ngừng so sánh các AI agent mà không công bố lớp vỏ". Kết luận của họ: chỉ cần đổi lớp vỏ, điểm số thay đổi ở mức ngang bằng hoặc lớn hơn chênh lệch giữa các mô hình khác nhau.

Nếu điều đó đúng — và kết quả tuần trước là minh chứng đắt giá — thì mọi bảng xếp hạng mô hình bạn từng dùng để chọn nhà cung cấp đều đang đo một biến số không phải biến số quan trọng nhất.

Điều này nói gì với doanh nghiệp của bạn

Bạn không chạy ARC-AGI-3. Nhưng nếu doanh nghiệp bạn đang dùng hoặc sắp dùng AI, khuôn mẫu này áp dụng gần như nguyên vẹn.

Thứ nhất: ngừng hỏi "dùng model nào", bắt đầu hỏi "ai dựng phần còn lại". Khi một nhà cung cấp chào bạn giải pháp AI, câu hỏi "các anh dùng GPT hay Claude?" gần như không phân biệt được ai giỏi hơn ai — vì tất cả đều mua được cùng một mô hình, cùng một giá. Câu hỏi phân biệt là: hệ thống của các anh nhớ được gì giữa các lần chạy? Khi nó làm sai, cái gì phát hiện ra và sửa? Nếu không có câu trả lời cụ thể, bạn đang mua một động cơ không có xe.

Thứ hai: thành phần đắt giá nhất là thứ bắt lỗi. Chi tiết kỹ thuật đáng học nhất của cả VISTA lẫn AVO không phải mô hình, mà là bộ giám sát — thứ nhận ra khi agent đang giậm chân và kéo nó về. Trong doanh nghiệp cũng vậy: giá trị không nằm ở việc AI trả lời được, mà ở việc bạn biết khi nào nó trả lời sai trước khi khách hàng biết. Một chatbot không có lớp kiểm tra và không có đường thoát sang người thật là một rủi ro thương hiệu được trả tiền hàng tháng.

Thứ ba: cẩn thận với con số 100 trên sân nhà. NVIDIA đạt điểm tuyệt đối trên bộ công khai và nói rõ điều đó. Nhiều nhà cung cấp sẽ không nói rõ như vậy. Khi ai đó demo một hệ thống AI chạy hoàn hảo, câu hỏi duy nhất đáng hỏi là: cái này đã chạy trên dữ liệu nào mà các anh chưa từng nhìn thấy trước chưa? Demo trên bộ ví dụ đã chuẩn bị sẵn và vận hành trên dữ liệu thật của bạn là hai bài toán khác nhau — đúng như khoảng cách giữa bộ công khai và bộ riêng tư của ARC-AGI-3.

Thứ tư: lợi thế của bạn nằm ở phần bạn dựng. Mô hình thì ai cũng thuê được. Cái không mua được là quy trình riêng, dữ liệu riêng, và những quy tắc kiểm soát bạn đúc kết từ chính công việc của mình. Đó là lý do khi tích hợp AI vào website và quy trình, chúng tôi bắt đầu từ bài toán và luồng kiểm soát trước, chọn mô hình sau — và thiết kế để thay mô hình được, vì bảng xếp hạng sẽ còn đổi nhiều lần nữa.

Điều gì sẽ khiến tôi đổi ý

Tôi có thể sai, và tôi muốn nói rõ sai ở chỗ nào.

Nếu AVO — hoặc bất kỳ lớp vỏ nào — đạt điểm tương đương trên bộ riêng tư của ARC-AGI-3, tức những môi trường chưa ai từng nhìn thấy, thì lập luận "harness chỉ khơi ra năng lực có sẵn" trở nên yếu đi đáng kể, và luận điểm của NVIDIA mạnh hơn hẳn. Đó là phép thử sạch, và nó chưa diễn ra.

Cũng cần công bằng với NVIDIA: bài công bố của họ còn một kết quả ít được nhắc mà tôi thấy thuyết phục hơn cả điểm số benchmark. Trong bảy ngày, AVO tự thử hơn 500 hướng tối ưu, cho ra 40 phiên bản kernel được commit, và đạt hiệu năng cao hơn 10,5% so với FlashAttention-4 trên hệ thống DGX B200. Đó là công việc kỹ thuật thật, trên vấn đề thật, không phải game.

Nhưng đó lại càng củng cố điều tôi muốn bạn mang về: giá trị đến từ kiến trúc vận hành chạy bền bỉ trong bảy ngày, không đến từ việc chọn đúng cái tên trên bảng xếp hạng.

Ngày 21/8, thế giới đọc được rằng lớp vỏ đã soán ngôi mô hình. Đọc kỹ hơn, câu chuyện điềm đạm hơn và hữu ích hơn nhiều: mô hình bạn đang trả tiền có lẽ đã đủ giỏi. Thứ bạn chưa xây là phần còn lại.

Nguồn

Bài viết liên quan

An Tran Solutions
28 tháng 8, 202612 phút đọc

Một ngân hàng vừa để ChatGPT đặt lệnh cho khách — bài học lớn nhất nằm ở cái nút họ không giao cho AI

Ngày 25/8/2026, Scalable Capital mở nền tảng môi giới 60 tỷ euro cho ChatGPT, Claude và Grok. Báo chí giật tít con số 76%. Nhưng thứ đáng học không phải AI biết đầu tư — mà là cách họ vạch ranh giới, và một cánh cửa mới mà doanh nghiệp Việt chưa ai xây.

Zalo