An Tran Solutions
An Tran Solutions
Quay lại Blog

Claude Sonnet 5.5 rẻ hơn tới 30%, nhưng bảng giá không giảm một đồng — tiền được tiết kiệm ở chỗ khác

29 tháng 9, 20267 phút đọcbởi An Trần
Mục lục

Tiêu đề các bài báo hôm qua đều na ná nhau: Anthropic ra mắt Sonnet 5.5, nhanh hơn 30%, rẻ hơn tới 30%.

Câu thứ hai dễ gây hiểu nhầm. Bảng giá không hề giảm. Sonnet 5.5 vẫn tính 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra, đúng bằng Sonnet 5 (Anthropic, SiliconANGLE).

Vậy "rẻ hơn" đến từ đâu? Câu trả lời là điều đáng học nhất trong đợt ra mắt này, và nó áp dụng được cho cả doanh nghiệp không hề viết code.

Chuyện gì đã xảy ra, theo đúng ngày

  • Khoảng tháng 6/2026: Sonnet 5 ra mắt, theo TechCrunch là cách đây chừng ba tháng (TechCrunch).
  • Ngày 22/9/2026: Anthropic phát hành Opus 5.5, mẫu cao cấp của dòng 5.5 (SiliconANGLE).
  • Ngày 28/9/2026: Sonnet 5.5 ra mắt, có mặt trên mọi nền tảng lớn, gồm Amazon Web Services, Google Cloud và Microsoft Azure. Anthropic cũng cho biết Haiku 5.5 sẽ đến "trong vài tuần tới", chưa có ngày cụ thể (Anthropic).

Chỉ một tuần cách nhau giữa mẫu đắt và mẫu rẻ. Nhịp này có chủ đích, và ta sẽ quay lại ở phần cuối.

"Rẻ hơn 30%" thực ra là gì

Anthropic nói Sonnet 5.5 "costs up to 30% less for most work" so với Sonnet 5 và chạy nhanh hơn hơn 30% (Anthropic). Khoản tiết kiệm không nằm ở đơn giá. Nó nằm ở số token và số lượt gọi công cụ mà mô hình cần để xong việc: ít bước hơn, gom nhiều thao tác vào một lượt.

Vài con số Anthropic dẫn từ khách hàng thử nghiệm, xin nhấn mạnh đây là số do nhà cung cấp và khách hàng của họ công bố:

  • Zendesk: xử lý ticket nhanh hơn 20%.
  • Base44: Opus 5 cần trung bình 7,7 lượt lặp để hoàn thành một việc, Sonnet 5.5 chỉ cần 3,6.
  • Một khách hàng khác báo 121 nghìn token cho mỗi tác vụ so với 497 nghìn.

Đây là điểm tôi muốn bạn mang về: đừng so sánh giá theo token, hãy so sánh giá theo kết quả. Một mô hình đắt hơn 20% mỗi token nhưng làm xong trong nửa số bước vẫn rẻ hơn. Ngược lại, một mô hình "giá mềm" mà loay hoay mười vòng mới ra việc thì đắt hơn nhiều so với vẻ ngoài.

Số liệu độc lập khớp với hướng này nhưng cũng nhắc ta cẩn thận. Artificial Analysis xếp Sonnet 5.5 ở mức 56 điểm trên chỉ số trí tuệ của họ, so với 38 của Sonnet 5 và 58 của Opus 5.5. Chi phí chạy cùng một bộ bài kiểm tra dao động từ khoảng 0,41 USD đến 7,60 USD tùy mức "effort" được chọn (Artificial Analysis). Trang này có một chỗ số liệu tự mâu thuẫn ở bảng giá, nên tôi chỉ dùng phần điểm số và khoảng dao động, không dùng con số nào khác của họ.

Khoảng dao động gần 19 lần ấy nói lên một điều: cùng một mô hình, chi phí phụ thuộc nhiều vào cách bạn cấu hình nó. Người mua dịch vụ AI nên hỏi nhà cung cấp "bạn đặt mức effort nào và vì sao", không chỉ "bạn dùng mô hình nào".

Bảng benchmark: đọc kỹ trước khi vỗ tay

Theo bảng của Anthropic, Sonnet 5.5 đạt 70,6% trên Terminal-Bench 4.0, vượt cả Opus 5.5 (66,4%), và đạt 1844 Elo trên GDPval-AA v2.1, chỉ kém Opus 5.5 hai điểm (1846) (Anthropic).

Nghe rất ấn tượng. Nhưng có ba điều cần đọc cùng lúc.

Một, đây là bảng của chính Anthropic. TechCrunch cũng ghi rõ bài viết không có kiểm chứng độc lập nào về các tuyên bố này (TechCrunch). Các phép đo độc lập sẽ đến trong vài tuần tới; đến lúc đó hãy so lại.

Hai, chỗ nào Opus vẫn thắng thì bảng cũng nói. Trên FrontierCode 1.1, Sonnet 5.5 được 46,2% còn Opus 5.5 được 54,4% ở mức Xhigh. Chú thích của Anthropic còn thừa nhận Sonnet 5.5 điểm thấp hơn ở mức Max so với Xhigh do một số tác vụ review code bị quá thời gian (Anthropic). Tôi đánh giá cao việc họ ghi chú điều này. Nhưng nó cho thấy "98% điểm số của Opus" là con số trung bình, còn các bài khó nhất vẫn thuộc về mẫu đắt.

Ba, bước nhảy quá lớn thì nên nghi ngờ trước. Cũng trong bảng đó, Terminal-Bench của Sonnet 5 là 10,3%, còn Sonnet 5.5 là 70,6%. Chênh gấp bảy lần giữa hai đời cách nhau ba tháng nhiều khả năng phản ánh thay đổi cách chạy bài kiểm tra hoặc cách dùng công cụ, không thuần túy là mô hình "thông minh hơn bảy lần". Thực tế, chỉ số trí tuệ tổng hợp của Artificial Analysis tăng từ 38 lên 56, một bước tiến lớn nhưng không phải bảy lần. Khi một con số nhảy vọt, hãy hỏi nó đo cái gì trước khi hỏi nó tốt cỡ nào.

Điều ít người để ý: "hạ cấp" có chủ đích

Đây là chi tiết tôi thấy đáng nói nhất, và nó nằm ở phần an toàn chứ không phải phần hiệu năng.

Sonnet 5.5 là mẫu Sonnet đầu tiên ra mắt cùng các biện pháp bảo vệ an ninh mạng tương tự Opus 5.5. Anthropic viết rằng các tác vụ an ninh mạng rủi ro cao hơn sẽ "visibly fall back to Sonnet 5", tức là tự động chuyển về mô hình cũ và người dùng nhìn thấy điều đó (Anthropic). Đây cũng là Sonnet đầu tiên có bộ phân loại ngăn việc trích xuất chuỗi suy luận.

Ý nghĩa với doanh nghiệp rất cụ thể. Nếu bạn xây công cụ trên Sonnet 5.5 và một số yêu cầu chạm ngưỡng nhạy cảm, chất lượng đầu ra có thể khác với những gì bạn đã kiểm thử. Anthropic cũng thừa nhận một lỗi triển khai trước ngày ra mắt ảnh hưởng đến structured output, và đã sửa. Nếu sản phẩm của bạn phụ thuộc vào định dạng đầu ra chặt chẽ, hãy chạy lại bộ kiểm thử của mình thay vì tin rằng "bản mới" chắc chắn tốt hơn.

Ba điều nên làm sau tin này

  1. Tính chi phí trên mỗi kết quả. Chọn 20 tác vụ thật của doanh nghiệp, chạy trên cả hai mẫu, đo tổng chi phí và số lần phải sửa tay. Đó mới là con số bạn trả.
  2. Đừng mặc định dùng mẫu đắt nhất. Với công việc rõ ràng, có phạm vi hẹp như sửa lỗi, soạn tài liệu, làm bảng tính, mẫu tầm trung nay đủ dùng. Anthropic tự mô tả Sonnet 5.5 mạnh nhất ở đúng những việc này. Giữ mẫu cao cấp cho những bài thực sự khó.
  3. Hỏi nhà cung cấp về cấu hình. Mức effort, giới hạn token, cơ chế tự chuyển mô hình: tất cả đều ảnh hưởng đến hóa đơn cuối tháng.

Điều nó báo trước

Chỉ một tuần giữa Opus 5.5 và Sonnet 5.5, rồi Haiku 5.5 sắp tới. Các hãng đang dọn sạch khoảng cách giữa các bậc giá. Khi mẫu tầm trung đạt gần như điểm số của mẫu đầu bảng, lợi thế cạnh tranh của một sản phẩm AI không còn nằm ở việc "dùng mô hình mạnh nhất". Nó nằm ở cách bạn dùng mô hình đó: đúng việc, đúng cấu hình, có đo lường.

Nếu bạn đang cân nhắc đưa AI vào website hoặc quy trình bán hàng, đó là phần chúng tôi thường làm cùng khách hàng, xem thêm tại dịch vụ tích hợp AI hoặc liên hệ để trao đổi cụ thể.

Nguồn

Bài viết liên quan

An Tran Solutions
29 tháng 9, 20269 phút đọc

OpenAI Dừng Huấn Luyện Mô Hình Mạnh Nhất Vì Agent Thoát Sandbox — Nhưng Lỗi Không Nằm Ở Chỗ Bạn Nghĩ

Ngày 25/9/2026, OpenAI công bố một agent nội bộ đã thoát khỏi môi trường cô lập qua DNS, và tạm dừng huấn luyện các mô hình mạnh nhất. Tiêu đề nói về 'AI nổi loạn'. Bài học thật cho doanh nghiệp lại rất đời thường: quyền truy cập, giám sát và nút dừng khẩn cấp.

Zalo