Mục lục
Câu chuyện mà ai cũng đang kể về AI là một cuộc đua song mã: OpenAI đấu với Anthropic, Google chen vào giữa, và cả thế giới hồi hộp xem ai ra mô hình mạnh nhất. Bạn được dạy rằng chọn đúng "nhà vô địch" là quyết định chiến lược.
Câu chuyện đó đã cũ. Trong khi báo chí đếm điểm benchmark của các phòng thí nghiệm hàng đầu, một phần ba lượng token AI mà lập trình viên và doanh nghiệp Mỹ tiêu thụ mỗi tuần đã âm thầm chuyển sang mô hình Trung Quốc. Không phải vì yêu nước ngược. Vì rẻ hơn tới 90%.
Đây không phải tin đồn. Ngày 7/7/2026, CNBC công bố một điều tra dựa trên dữ liệu định tuyến thực tế của OpenRouter — nền tảng trung gian mà hàng chục nghìn nhà phát triển dùng để gọi API tới mọi mô hình AI. Con số trong đó nên khiến bất kỳ ai đang lập ngân sách công nghệ phải ngồi thẳng lưng.
Con số khiến cả Thung lũng Silicon giật mình
Theo dữ liệu OpenRouter mà CNBC dẫn lại: tính đến giữa năm 2026, mô hình có nguồn gốc Trung Quốc chiếm 46,4% tổng lượng token được định tuyến trong tuần cao điểm — vượt qua cả mô hình gốc Mỹ, vốn chỉ còn 35,7%.
Hãy để con đó chìm xuống một chút. Nhà cung cấp Mỹ lớn nhất trên nền tảng này là Anthropic, chỉ chiếm 14,8%. Trong khi đó DeepSeek một mình gánh 17,6% — tương đương 5,13 nghìn tỷ token mỗi tuần, biến nó thành nhà cung cấp đơn lẻ lớn nhất toàn nền tảng. Qwen của Alibaba đứng thứ hai với 13,9% (2,77 nghìn tỷ token/tuần).
Điều đáng chú ý không phải là bức ảnh chụp một thời điểm, mà là tốc độ. Cùng bộ dữ liệu đó cho thấy:
- Nửa đầu năm 2025, mô hình Trung Quốc chỉ chiếm 4,5% lưu lượng.
- Trung bình 12 tháng trước đó là 11%.
- Nhưng kể từ ngày 8/2/2026, tuần nào chúng cũng vượt mốc 30%.
- Và trong tuần 9–15/2/2026, lần đầu tiên mô hình Trung Quốc vượt mô hình Mỹ về tổng token.
Từ 4,5% lên 46% chỉ trong hơn một năm. Đây không phải một xu hướng đang hình thành. Đây là một cuộc di cư đã xảy ra rồi, chỉ là hầu hết mọi người chưa nhìn vào đúng biểu đồ.
"Rẻ hơn 90%" không phải khuyến mãi — đó là mô hình kinh doanh
Vì sao dòng chảy đảo chiều nhanh đến vậy? Ông Justin Summerville của OpenRouter nói thẳng với CNBC: "Mô hình mã nguồn mở Trung Quốc rẻ hơn đều đặn 60% đến 90% so với các sản phẩm hàng đầu của Anthropic và OpenAI."
Nhìn vào bảng giá thì hiểu ngay vì sao. Đây là chi phí cho mỗi triệu token đầu ra, theo phân tích của byteiota tổng hợp giá tháng 6–7/2026:
| Mô hình | Giá / 1 triệu token đầu ra |
|---|---|
| DeepSeek V4 Flash | 0,28 USD |
| Qwen 3.6 Max | 1,20 USD |
| GLM-5.2 (giấy phép MIT) | 4,40 USD |
| Claude Sonnet 5 | 10,00 USD* |
| GPT-5.5 | 30,00 USD |
*Giá Claude Sonnet 5 là mức ưu đãi ra mắt, áp dụng đến hết tháng 8/2026, sau đó tăng lên 15 USD/triệu token. Ở đầu vào, khoảng cách còn khốc liệt hơn: DeepSeek V4 Flash tính 0,14 USD/triệu token, còn GPT-5.5 là 5,00 USD — chênh nhau hơn 35 lần.
Khoảng cách gần 100 lần giữa DeepSeek và GPT-5.5 không phải sai số làm tròn. Đó là một mô hình kinh doanh khác hẳn.
Và đây là chỗ lập luận "đắt hơn thì tốt hơn" bắt đầu sụp đổ. GLM-5.2 của Z.ai — công bố ngày 13/6/2026, mở trọng số theo giấy phép MIT — đạt 62,1% trên SWE-bench Pro (bộ đo năng lực lập trình thực tế), vượt GPT-5.5 ở mức 58,6%, với chi phí chỉ bằng khoảng một phần sáu. Khi mô hình rẻ hơn sáu lần lại làm bài kiểm tra tốt hơn, cái "lý do chất lượng" để trả giá gấp mười lần trở nên rất khó biện minh.
Chi phí này càng quan trọng với tác vụ agentic — nơi AI tự lặp đi lặp lại 50–200 lượt gọi để hoàn thành một nhiệm vụ. Với khối lượng đó, chênh lệch giá không cộng dồn tuyến tính, nó nhân lên theo cấp số. Một quy trình tự động chạy trên GPT-5.5 có thể ngốn ngân sách gấp hàng chục lần cùng quy trình đó chạy trên DeepSeek — để cho ra kết quả gần như không phân biệt được với người dùng cuối.
Vì sao đây là tin quan trọng với doanh nghiệp Việt
Bạn có thể nghĩ: "Tôi đâu có xây mô hình AI, chuyện này liên quan gì tới tôi?" Liên quan trực tiếp. Bởi vì tin này báo hiệu một sự dịch chuyển mà mọi chủ doanh nghiệp cần hiểu: lớp mô hình AI đang trở thành hàng hóa (commodity).
Cách đây hai năm, "AI mạnh nhất" là một tài sản khan hiếm, đắt đỏ, và ai sở hữu quyền truy cập tốt hơn thì có lợi thế. Hôm nay, năng lực đủ-tốt-cho-99%-công-việc-kinh-doanh có thể mua với giá gần như bằng không. Trợ lý chăm sóc khách hàng, phân loại email, viết nháp nội dung, tóm tắt tài liệu, hỗ trợ lập trình — những việc này không cần mô hình đắt nhất hành tinh. Chúng cần một mô hình đủ tốt, ổn định và rẻ.
Điều đó có ba hệ quả thẳng thừng cho ngân sách của bạn:
Một: nếu ai đó báo giá "giải pháp AI" cho bạn dựa trên việc họ dùng mô hình xịn nhất, hãy hỏi lại. Với phần lớn tác vụ vận hành, đó là chi phí bạn đang trả cho sự an tâm, không phải cho kết quả. Sự khác biệt về chất lượng đầu ra ngày càng mỏng, còn chênh lệch chi phí thì gấp hàng chục lần.
Hai: chi phí AI của bạn sẽ giảm, không tăng. Đừng khóa mình vào hợp đồng dài hạn với giả định giá AI đắt đỏ. Toàn bộ đường cong đang lao xuống. Cái hôm nay tốn 100 đồng, sang năm có thể tốn 10.
Ba: đừng đặt cược cả doanh nghiệp vào một mô hình duy nhất. Đây có lẽ là bài học đắt giá nhất trong cả câu chuyện.
Nhưng rẻ không có nghĩa là miễn phí rủi ro
Sẽ là thiếu trung thực nếu tôi dừng ở đây và bảo bạn "chuyển hết sang mô hình Trung Quốc để tiết kiệm." Không đơn giản vậy, và người làm nghề tử tế phải nói rõ mặt trái.
Khi bạn gọi thẳng API tới một nhà cung cấp Trung Quốc, dữ liệu của bạn đi qua hạ tầng của họ. Điều đó kéo theo những câu hỏi thật:
- Chủ quyền dữ liệu. Luật An ninh Quốc gia của Trung Quốc có thể buộc doanh nghiệp trong nước hợp tác cung cấp dữ liệu. Với doanh nghiệp có khách hàng ở châu Âu, việc gửi dữ liệu cá nhân qua đây còn có thể vướng Điều 46 của GDPR.
- Rủi ro địa chính trị. Quốc hội Mỹ đã mở điều tra một số công ty tích hợp mô hình Trung Quốc. Ở chiều ngược lại, Trung Quốc cũng đang cân nhắc siết quyền truy cập mô hình từ nước ngoài. Bạn có thể rơi vào một thị trường bị chia đôi, nơi phụ thuộc kỹ thuật của bạn bị cắt bởi một trong hai chính phủ.
Vậy nên nguyên tắc không phải "rẻ nhất thắng", mà là phân luồng theo mức độ nhạy cảm. Dữ liệu công khai, tác vụ khối lượng lớn ít rủi ro — mô hình rẻ. Dữ liệu khách hàng, thông tin nhạy cảm, đầu ra đại diện cho thương hiệu — chọn mô hình và nhà cung cấp mà bạn tin tưởng về quản trị dữ liệu, và cân nhắc định tuyến qua cổng trung gian đặt tại Mỹ/EU thay vì gọi thẳng. Rẻ là một biến số, không phải mục tiêu duy nhất.
Điều thật sự tạo lợi thế (không phải mô hình)
Đây là kết luận mà tôi muốn bạn mang theo. Nếu lớp mô hình đang biến thành hàng hóa mà ai cũng thuê được với giá gần bằng không, thì mô hình không thể là lợi thế cạnh tranh của bạn. Đối thủ của bạn thuê được đúng con AI đó, với đúng mức giá đó, trong cùng một buổi chiều.
Lợi thế nằm ở những thứ không thuê được ngoài chợ:
- Dữ liệu riêng của bạn — hiểu biết về khách hàng, lịch sử giao dịch, ngữ cảnh ngành mà không mô hình công cộng nào có.
- Quy trình của bạn — cách bạn ghép AI vào vận hành để nó thật sự tạo ra kết quả, thay vì một tính năng gắn cho vui.
- Kênh phân phối và thương hiệu — niềm tin của khách hàng, thứ mà không API nào tặng kèm.
AI chỉ là nguyên liệu đầu vào, ngày càng rẻ, ngày càng sẵn. Cái quyết định thắng thua là bạn nấu nó thành món gì. Doanh nghiệp khôn ngoan trong 2026 không hỏi "mô hình nào mạnh nhất?", mà hỏi "làm sao ghép AI vào đúng chỗ trong quy trình để tạo giá trị thật, với chi phí bền vững, và không tự trói mình vào một nhà cung cấp?"
Đó chính xác là cách chúng tôi tiếp cận khi tích hợp AI vào website và quy trình cho khách hàng: chọn mô hình theo bài toán chứ không theo thương hiệu, thiết kế để dễ thay thế khi giá thị trường đổi, và đặt dữ liệu cùng trải nghiệm khách hàng làm phần lõi — vì đó mới là phần không ai sao chép được.
Cuộc đua AI vẫn đang diễn ra. Chỉ là kẻ thắng thầm lặng của năm nay không phải mô hình đắt nhất — mà là ai hiểu rằng mô hình chưa bao giờ là điểm mấu chốt.
Nguồn
- Chinese AI models are gaining ground with U.S. companies as OpenAI, Anthropic costs surge — CNBC, 7/7/2026
- Chinese AI Models Now Capture Up to 46% of US Enterprise Token Usage — Yahoo Finance (dẫn lại CNBC), 9/7/2026
- Chinese AI Models Hit 46% of US API Tokens: What Developers Must Do Now — byteiota
- Chinese AI Models Surpass 30% of US Developer Traffic on OpenRouter — MLQ News
- GLM 5.2 — API Pricing & Benchmarks, OpenRouter

