Mục lục
Ai cũng nghĩ "AI xịn" đồng nghĩa với ba cái tên Mỹ: ChatGPT, Claude, Gemini. Doanh nghiệp nghiêm túc thì phải xây trên chúng. Phần còn lại chỉ là hàng nhái giá rẻ.
Thị trường lập trình viên vừa bỏ phiếu ngược lại — và gần như không ai để ý.
Ngày 7/7/2026, MiMo-V2-Pro của Xiaomi trở thành mô hình được dùng nhiều nhất trên OpenRouter tính theo lượng token mỗi tuần, theo tổng hợp tin tức của Buildfast. Một hãng làm điện thoại. Vượt qua OpenAI. Trên nền tảng định tuyến AI lớn nhất dành cho giới xây sản phẩm.
Đó không phải một sự cố. Đó là điểm cuối của một xu hướng kéo dài cả năm mà các tiêu đề về "chạy đua mô hình lớn nhất" đã bỏ lỡ hoàn toàn.
Con số khiến mọi người sốc
Hãy nhìn thẳng vào dữ liệu, không phải cảm giác.
Theo biểu đồ của Bloomberg dựng từ số liệu OpenRouter và Exponential View, được officechai tổng hợp: thị phần token của các mô hình Mỹ (OpenAI, Google, Anthropic cộng lại) trên OpenRouter đã rớt từ khoảng 70% (tháng 6/2025) xuống còn khoảng 30% (tháng 6/2026). Trong đúng 12 tháng.
Ở chiều ngược lại, các mô hình Trung Quốc chiếm phần lớn lượng token được xử lý. Tùy cách đếm, con số dao động: khoảng 44–46% theo số liệu tháng 4–6/2026, và lên tới ~61% theo một thống kê tháng 5/2026 của Data Gravity. Khác biệt nằm ở phương pháp đo — đếm token đã định danh hay toàn bộ — nhưng hướng đi thì không có gì phải bàn cãi.
Chi tiết đáng chú ý hơn: DeepSeek một mình chiếm khoảng 16% tổng lượng token trên OpenRouter, và OpenAI tụt xuống hạng tư tính theo lượng token của từng công ty. Google — theo phân tích của Data Gravity — sụp từ 37% xuống 13%. Llama của Meta thì rơi hẳn khỏi bảng xếp hạng.
Đây không phải thị phần doanh thu. Đây là thị phần công việc thực tế — số token mà lập trình viên và sản phẩm thật sự đốt mỗi ngày. Và ở thước đo đó, "hàng nhái giá rẻ" đã trở thành con ngựa thồ của cả nền kinh tế AI.
Vì sao? Không phải vì chúng thông minh hơn
Đây là chỗ dễ hiểu sai. Các mô hình Trung Quốc thắng không phải vì vượt Claude hay GPT về trí thông minh thô. Chúng thắng vì một phép tính mà bất kỳ chủ doanh nghiệp nào cũng làm được: giá trên hiệu năng.
Con số cụ thể:
- Một phiên code một giờ với Claude tốn khoảng 10 USD; làm việc tương đương với DeepSeek: dưới 0,5 USD, theo Rest of World.
- Data Gravity ước tính DeepSeek-V4-Pro rẻ hơn ~12 lần so với GPT-5.5 ở mức benchmark tương đương.
- Trên OpenRouter tháng 4/2026, MiMo V2 Pro của Xiaomi có giá 1 USD / 3 USD cho mỗi triệu token đầu vào/đầu ra, với cửa sổ ngữ cảnh 1 triệu token. Qwen 3.6 Plus của Alibaba thậm chí miễn phí ở bản preview, cũng ngữ cảnh 1 triệu token, theo báo cáo Q2 2026 của digitalapplied.
Flo Crivello, nhà sáng lập Lindy — công ty đã chuyển từ Anthropic sang DeepSeek và tiết kiệm hàng triệu đô — tóm gọn bằng một câu đắt giá:
"Bạn không cần đến Chúa để viết email hộ. Nếu có thể mua mức trí tuệ thấp hơn đó với một phần mười giá tiền, không làm mới là dại."
Câu đó là cả một chiến lược. Và nó nối thẳng vào lý do thứ hai: trọng số mở.
Khác với API đóng của Mỹ, hầu hết các mô hình Trung Quốc dẫn đầu đều là open-weight — tải về, tự vận hành, không khóa nhà cung cấp, giảm chi phí mỗi token xuống thêm một nấc. Cùng lúc đó, tính chất công việc trên OpenRouter dịch chuyển mạnh sang lập trình: từ 11% lên 50% tổng lượng dùng trong 12 tháng (Data Gravity). Mà code là loại việc "khối lượng lớn, lặp lại, nhạy giá" — đúng miếng bánh mà mô hình rẻ nuốt gọn.
Tốc độ ra bản mới cũng là một vũ khí: Moonshot đã tung năm bản Kimi lớn trong chưa đầy một năm, nhanh hơn cả chu kỳ mua sắm của doanh nghiệp.
Bài học thật sự cho doanh nghiệp: đừng trả giá "thương hiệu"
Nếu bạn đang tích hợp AI vào sản phẩm hay quy trình, đây là phần đáng tiền nhất của bài viết.
Sai lầm phổ biến nhất tôi thấy: chọn một mô hình đắt tiền, nổi tiếng cho mọi tác vụ — từ phân loại email, tóm tắt ticket, đến sinh mô tả sản phẩm. Đó là mua siêu xe để đi chợ. Bạn đang trả một khoản "phí thương hiệu" mà thị trường lập trình viên đã ngừng trả từ lâu.
Khung tư duy đúng là phân tầng trí tuệ (intelligence tiering) — ghép đúng cấp mô hình với đúng giá trị công việc:
- Việc lặp lại, khối lượng lớn, sai số thấp (phân loại, trích xuất, tóm tắt, trả lời FAQ): dùng mô hình mở giá rẻ. Đây là 80% khối lượng thật của đa số doanh nghiệp.
- Việc cần suy luận sâu, sáng tạo, hoặc chịu rủi ro cao (tư vấn phức tạp, code kiến trúc, nội dung mặt tiền thương hiệu): mới cần đến mô hình frontier đắt tiền.
Làm đúng, hóa đơn AI của bạn có thể giảm một bậc độ lớn mà chất lượng đầu ra người dùng cảm nhận không đổi. Đó không phải cắt giảm — đó là kỹ thuật.
Và đây là điểm mấu chốt về mặt kiến trúc: đừng khóa mình vào một nhà cung cấp. Lý do OpenRouter tồn tại — và lý do nó là nơi cuộc dịch chuyển này diễn ra — là vì nó cho phép định tuyến giữa hàng chục mô hình sau một API duy nhất. Sản phẩm nào thiết kế để đổi mô hình dễ dàng thì tuần sau có mô hình rẻ hơn 12 lần, bạn chỉ đổi một dòng cấu hình. Sản phẩm nào hàn chết vào một API độc quyền thì trả giá đầy đủ, mãi mãi.
Nhưng "rẻ hơn" không tự động là "đúng"
Tôi sẽ không bán cho bạn câu chuyện một chiều. Có hai lý do thật sự để chưa vội chuyển sạch sang mô hình Trung Quốc.
Thứ nhất — chất lượng ở đỉnh vẫn quan trọng. Dario Amodei, CEO Anthropic, lập luận rằng các mô hình Trung Quốc được "tối ưu cho benchmark và chưng cất từ các phòng lab Mỹ", và về dài hạn thì năng lực thô, không phải giá, mới quyết định được chọn hay không (officechai). Lập luận này gây tranh cãi — dữ liệu thị phần đang phản bác ông — nhưng nó không sai ở phần đỉnh: với việc thật sự khó, khoảng cách chất lượng vẫn còn và vẫn đáng tiền.
Thứ hai — rủi ro quản trị dữ liệu là có thật. Rest of World cho biết Airbnb và Anysphere từng bị Quốc hội Mỹ điều tra vì dùng mô hình mở Trung Quốc (Qwen, Kimi). Với doanh nghiệp Việt Nam xử lý dữ liệu khách hàng, câu hỏi "dữ liệu chạy qua đâu, ai kiểm soát trọng số, lưu ở máy chủ nào" không phải chuyện phụ. Ưu điểm open-weight — tự host — cũng chính là câu trả lời tốt nhất cho lo ngại này: chạy mô hình trên hạ tầng bạn kiểm soát, dữ liệu không rời khỏi nhà.
Cho nên kết luận không phải "bỏ Claude, xài DeepSeek". Kết luận là: ngừng mặc định trả giá cao nhất, và bắt đầu thiết kế có chủ đích.
Điều này báo hiệu gì
Cuộc dịch chuyển 70% → 30% nói lên một sự thật lớn hơn về ngành: lớp mô hình đang bị thương mại hóa (commoditized). Lợi thế không còn nằm ở "ai có mô hình thông minh nhất tuần này", mà ở lớp bạn xây bên trên mô hình — quy trình, dữ liệu riêng, trải nghiệm, khả năng đổi mô hình linh hoạt.
Với chủ doanh nghiệp, thông điệp gọn lại thành một câu: hóa đơn AI của bạn là một lựa chọn chiến lược, không phải một khoản cố định. Ai hiểu điều đó sẽ chạy cùng chất lượng với chi phí bằng một phần mười đối thủ. Ai không hiểu sẽ tiếp tục trả phí thương hiệu cho việc viết email.
Ở An Tran Solutions, khi tích hợp AI vào sản phẩm, chúng tôi thiết kế theo đúng nguyên tắc này: phân tầng mô hình theo giá trị công việc và giữ khả năng đổi nhà cung cấp — để bạn không bao giờ bị khóa vào một hóa đơn. Nếu bạn muốn biết quy trình của mình đang trả dư ở đâu, nói chuyện với chúng tôi.
Thị trường lập trình viên đã bỏ phiếu. Câu hỏi còn lại chỉ là bạn có đọc kết quả không.
Nguồn
- Share Of US Models Being Used On OpenRouter Has Collapsed From 70% To 30% Over The Past Year — officechai (dữ liệu Bloomberg / OpenRouter / Exponential View)
- Low-cost Chinese AI models like DeepSeek gain traction in the U.S. — Rest of World (17/6/2026)
- Chinese AI Models Q2 2026: 10-Provider Landscape Report — digitalapplied
- China's Open-Weight Takeover — Data Gravity
- AI News Today July 7 2026 — Buildfast

