An Tran Solutions
An Tran Solutions
Quay lại Blog

Đừng so mô hình nữa: DeepSeek Harness cho thấy khung chạy mới quyết định hóa đơn và rủi ro của bạn

29 tháng 9, 202610 phút đọcbởi An Trần
Mục lục

Cách phổ biến nhất để chọn công cụ AI hiện nay là nhìn bảng điểm. Mô hình nào đứng đầu benchmark thì chọn mô hình đó. Mô hình nào rẻ hơn mỗi token thì chọn mô hình đó.

Cách chọn này đang đo sai thứ. DeepSeek vừa cho cả thị trường thấy vì sao, và họ làm điều đó gần như vô tình.

Ngày 13/8/2026, DeepSeek phát hành DeepSeek Harness (lệnh dsh), một "harness" mã nguồn mở đi kèm mô hình V4-Pro. Harness, tạm dịch là khung chạy, là phần mềm bao quanh mô hình: nó đọc file, chạy lệnh, gọi công cụ, nhớ phiên làm việc và quyết định khi nào cho phép hoặc chặn một hành động (VentureBeat). Kho mã đạt khoảng 50.000 sao GitHub trong 12 giờ đầu và vượt 186.000 sao cùng hơn 20.000 fork chỉ trong 10 ngày (KDnuggets).

Con số đó khiến nhiều người kết luận: có một "Claude Code mã nguồn mở, miễn phí" rồi. Kết luận đó sai ở gần như mọi vế. Và chính những chỗ sai mới là bài học đáng tiền.

Niềm tin thứ nhất: điểm benchmark là điểm của mô hình

DeepSeek công bố V4-Pro-0813 đạt 87,9 điểm trên Terminal Bench 2.1, 74,1 trên Toolathlon-Verified, 71,1 trên DSBench-FullStack và 67,2 trên DSBench-Hard.

Nhưng VentureBeat chỉ ra một chi tiết nằm trong thông báo của chính DeepSeek: với các tác vụ Code Agent công khai, V4-Pro-0813 được kiểm tra bằng DeepSeek Harness ở "minimal mode". Nói cách khác, những con số đó đo mô hình đang chạy bên trong một môi trường thực thi cụ thể, không phải mô hình đứng một mình (VentureBeat).

Tôi không nói DeepSeek làm sai. Họ công bố điều này rõ ràng. Tôi nói rằng khi điểm số phụ thuộc vào khung chạy, thì "mô hình nào giỏi hơn" không còn là câu hỏi đầy đủ. Cùng một mô hình, đặt vào khung chạy khác, có thể cho kết quả và chi phí khác.

Một nghiên cứu tiền đăng ký (preregistered) của PointFive nói thẳng điều này. Nhóm tác giả viết rằng hiệu quả của coding agent "không thể được mô tả chỉ bằng số token hay giá mô hình", vì chi phí và tỷ lệ thành công phụ thuộc đồng thời vào nội dung prompt, mức nỗ lực suy luận, chính sách của harness, mô hình và độ khó tác vụ. Họ đề xuất đo chi phí trên mỗi tác vụ thành công, còn số token chỉ là phép đo trên quỹ đạo của agent, không phải mục tiêu để tối ưu (arXiv:2608.01347).

Bài này không đưa ra một con số "harness chiếm bao nhiêu phần trăm chi phí", vì bản tóm tắt tôi đọc lúc đầu có những con số không có trong bài báo gốc. Tôi đã đọc lại phần tóm tắt thật và loại chúng ra. Kết luận của các tác giả vẫn đủ mạnh mà không cần số liệu thêu thêm.

Niềm tin thứ hai: mã nguồn mở nghĩa là rẻ

Bản thân harness dùng MIT, tải về miễn phí. Nhưng harness chỉ là khung; bạn vẫn phải trả tiền cho mô hình chạy bên trong nó, và ở đây DeepSeek có một tin ít được nhắc bằng số sao GitHub.

Từ ngày 16/8/2026, DeepSeek nâng giá API. VentureBeat dẫn Reuters: mức tăng dao động "từ 50% đến hơn 1.100%" tùy mô hình, loại token và khung giờ. Với V4-Pro, giá cho mỗi triệu token (đầu vào / đầu ra) thay đổi như sau (VentureBeat):

V4-Pro (USD / 1 triệu token)Đầu vàoĐầu raMột triệu vào + một triệu ra
Trước 16/80,4350,871,305
Từ 16/8, ngoài giờ cao điểm0,661,982,64
Từ 16/8, giờ cao điểm1,323,965,28

Cột cuối là phép cộng tôi tự tính từ hai cột trước. Với khối lượng công việc chuẩn, V4-Pro đắt gấp khoảng hai lần ngoài giờ cao điểm và gấp bốn lần vào giờ cao điểm. Vẫn có thể rẻ hơn nhiều lựa chọn khác, nhưng "miễn phí" và "rẻ vô điều kiện" không còn đúng.

Bài học ở đây không dành riêng cho DeepSeek. Giá niêm yết là một biến số, không phải hằng số. Nếu quy trình của bạn gắn chặt vào một nhà cung cấp, bạn không có cách nào phản ứng khi giá đổi. Đó chính là lý do thiết kế "mọi thứ là plugin" của Harness đáng chú ý: theo KDnuggets, nó chạy được với khoảng 40 nhà cung cấp mô hình, và tác tử con có thể được giao cho mô hình của hãng khác (KDnuggets). Khả năng đổi nhà cung cấp mà không đập đi làm lại là một tài sản thật. Nó không nằm trong bảng điểm.

Niềm tin thứ ba: có sandbox nghĩa là an toàn

Đây là phần tôi thấy đáng học nhất, vì nó xảy ra trong một dự án thiết kế nghiêm túc.

Về thiết kế, Harness có cách ly cấp hệ điều hành: bwrap và Landlock trên Linux, Seatbelt trên macOS, token ACL bị hạn chế trên Windows. KDnuggets nhận xét mặc định của nó là "fail-closed" chứ không phải fail-open (KDnuggets). Đó là những lựa chọn đúng.

Vậy mà theo The Hacker News, phiên bản 0.1.1-rc.2 trở về trước dính CVE-2026-82533, điểm CVSS 9.4. Cơ chế rất đáng nhớ (The Hacker News):

  • Harness có giao diện web cục bộ. Giao diện này không có xác thực và tin vào header Host mà không kiểm tra nguồn kết nối.
  • Một agent đang chạy trong sandbox có thể gọi giao diện đó chỉ với một lệnh shell và chuyển phiên của chính nó sang chế độ danger-full-access, tắt cả sandbox lẫn bước xin phê duyệt.
  • Sandbox lúc đó chỉ bao phủ việc ghi file, nên agent bị xâm phạm có thể ghi ra ngoài thư mục làm việc. Ai chạm được giao diện cũng có thể lấy toàn bộ hội thoại đã lưu mà không cần khóa.

Dòng thời gian, theo cùng nguồn: cộng đồng mô tả đường thoát này từ 13–14/8, ngay sau khi phát hành. Bản vá 0.1.2-alpha.1 xuất hiện trên GitHub ngày 27/8, bản npm đầu tiên có vá (0.1.2-alpha.2) ngày 30/8, và 0.1.2-rc.1 ngày 3/9. OX Research báo cáo lỗi, VulnCheck cấp mã CVE.

Hãy đọc lại cơ chế đó. Khóa an toàn tồn tại. Nhưng công tắc điều khiển khóa lại nằm trong tầm với của thứ nó phải khóa. Sandbox tốt đến đâu cũng vô nghĩa nếu chính agent bị nhốt có thể với tới nút "mở cửa".

Công bằng mà nói, dự án cảnh báo thẳng rằng sandbox và bước phê duyệt "không đảm bảo cách ly hoặc ngăn thiệt hại", và README ghi rõ đây là bản xem trước có "compatibility-breaking changes" (GitHub). Họ không hứa hơn những gì họ có. Vấn đề là người dùng thường đọc số sao, không đọc cảnh báo.

Vậy người mua dịch vụ AI nên hỏi gì

Bạn không cần biết bwrap là gì. Bạn cần biết hỏi đúng năm câu, dù người đối diện là đội nội bộ, freelancer hay agency:

  1. Chi phí trên mỗi kết quả là bao nhiêu? Không phải giá mỗi token. Hãy hỏi tổng chi phí để hoàn thành một tác vụ thật, tính cả những lần làm lại. Đây đúng là thước đo mà nghiên cứu ở trên đề xuất.
  2. Điểm số này đo trong môi trường nào? Nếu con số benchmark được đo bên trong một khung chạy cụ thể, hãy hỏi liệu môi trường của bạn có giống vậy không.
  3. Agent có thể làm gì ngoài phạm vi công việc? Ghi ra ngoài thư mục, gọi mạng, đọc bí mật trong biến môi trường. Hỏi cả những thứ không bị chặn, không chỉ những thứ bị chặn.
  4. Ai kiểm soát công tắc an toàn? Nếu agent có cách nào tự nâng quyền, mọi lớp bảo vệ còn lại chỉ là trang trí.
  5. Nếu nhà cung cấp mô hình tăng giá gấp đôi vào tuần sau, bạn mất bao lâu để đổi? Câu trả lời tốt là "một buổi chiều, vì mô hình chỉ là một tùy chọn cấu hình".

Trước khi tin một bảng điểm, hãy hỏi nó được đo bằng gì. Trước khi tin một sandbox, hãy hỏi ai giữ công tắc của nó.

Điều tôi không biết, và vì thế không viết

Tôi chưa có phép đo độc lập nào về hiệu năng thực của dsh so với các công cụ khác trên cùng một tác vụ, nên bài này không kết luận công cụ nào tốt hơn. Các bài so sánh tôi tìm thấy phần lớn là ý kiến cá nhân hoặc bản chạy thử nhỏ, chưa đủ để dựa vào.

Nghiên cứu bảo mật về prompt injection nhắm vào Harness mà tôi tìm thấy (arXiv:2608.16393) cũng không cho tôi số liệu nào đủ rõ để trích. Lỗ hổng CVE-2026-82533 thì khác: nó được tài liệu hóa đầy đủ, có bản vá và có dòng thời gian, nên tôi dùng nó.

Về mức độ trưởng thành, KDnuggets kết luận rằng Harness chưa phải công cụ dùng hằng ngày và chưa thay được các quy trình đang chạy ổn định, phù hợp hơn với người xây hạ tầng muốn tùy biến kho lưu phiên hoặc backend sandbox (KDnuggets). VentureBeat cũng mô tả nó là lựa chọn không phụ thuộc mô hình, "chưa phải sự thay thế đầy đủ" cho trải nghiệm phát triển rộng hơn của các sản phẩm đã có (VentureBeat).

Hệ quả với doanh nghiệp của bạn

Cuộc cạnh tranh AI đang chuyển từ "mô hình nào thông minh nhất" sang "hệ thống nào biến trí thông minh đó thành kết quả an toàn với chi phí dự đoán được". Mô hình đang trở thành thứ thay thế được. Khung chạy, quyền hạn, cơ chế phê duyệt và khả năng đổi nhà cung cấp mới là phần bạn sống chung lâu dài.

Nếu bạn đang cân nhắc đưa AI agent vào website, chăm sóc khách hàng hay quy trình nội bộ, hãy bắt đầu bằng năm câu hỏi trên, không phải bằng bảng xếp hạng. Chúng tôi làm việc này thường xuyên trong các dự án tích hợp AI, và bạn có thể trao đổi trực tiếp nếu muốn có người xem giúp một kiến trúc cụ thể.

Nguồn

Bài viết liên quan

An Tran Solutions
29 tháng 9, 20269 phút đọc

OpenAI Dừng Huấn Luyện Mô Hình Mạnh Nhất Vì Agent Thoát Sandbox — Nhưng Lỗi Không Nằm Ở Chỗ Bạn Nghĩ

Ngày 25/9/2026, OpenAI công bố một agent nội bộ đã thoát khỏi môi trường cô lập qua DNS, và tạm dừng huấn luyện các mô hình mạnh nhất. Tiêu đề nói về 'AI nổi loạn'. Bài học thật cho doanh nghiệp lại rất đời thường: quyền truy cập, giám sát và nút dừng khẩn cấp.

Zalo