OpenAI giảm giá GPT-5.6 Luna 80%, Terra 20%: ChatGPT, Codex và API được lợi gì?

OpenAI giảm giá GPT-5.6 Luna 80%, Terra 20%: ChatGPT, Codex và API được lợi gì?

Biểu đồ chi phí API GPT-5.6 trên bài đánh giá TroubleshootingBench
Chi phí API của các tầng GPT-5.6 trên TroubleshootingBench. Nguồn: OpenAI Deployment Safety.

OpenAI vừa thực hiện một trong những đợt điều chỉnh giá đáng chú ý nhất của dòng GPT-5.6: giá API của GPT-5.6 Luna giảm 80%, GPT-5.6 Terra giảm 20%, trong khi GPT-5.6 Sol có thêm chế độ xử lý nhanh dành cho những tác vụ cần phản hồi gấp. Thông báo được OpenAI công bố ngày 30/7/2026 theo giờ Mỹ, tương ứng với sáng 31/7 tại Việt Nam.

Điểm cần hiểu đúng là OpenAI không giảm giá thuê bao ChatGPT hoặc Codex. Thay đổi tập trung vào giá API và cách mức sử dụng Terra, Luna được quy đổi trong ChatGPT Work, Codex. Vì vậy, người dùng trả phí không nhất thiết thấy hóa đơn thuê bao hàng tháng thấp hơn, nhưng cùng một hạn mức có thể xử lý được nhiều công việc hơn trước.

Đây không chỉ là một đợt “sale token”. Nó cho thấy chiến lược mới của OpenAI: thay vì buộc mọi tác vụ phải chạy trên mô hình mạnh nhất, hãng muốn doanh nghiệp phân tầng workload rõ ràng hơn, dùng Luna cho khối lượng lớn, Terra cho phần việc cân bằng giữa chất lượng và chi phí, còn Sol chỉ dành cho những bài toán thực sự cần năng lực suy luận cao.

Tóm tắt nhanh: GPT-5.6 Luna còn 0,20 USD cho một triệu token đầu vào và 1,20 USD cho một triệu token đầu ra; Terra còn 2 USD đầu vào và 12 USD đầu ra; Sol giữ nguyên mức giá tiêu chuẩn nhưng có Fast mode nhanh khoảng 2,5 lần với chi phí bằng 2 lần chế độ Standard. Giá thuê bao ChatGPT và Codex không đổi.

X OpenAIOpenAI 2082878156483219672 4 680x531

OpenAI đã thay đổi giá GPT-5.6 như thế nào?

Theo thông báo chính thức của OpenAI, bảng giá mới có hiệu lực từ ngày 30/7/2026. GPT-5.6 Luna là mô hình được giảm mạnh nhất, từ 1 USD xuống 0,20 USD cho một triệu token đầu vào và từ 6 USD xuống 1,20 USD cho một triệu token đầu ra. Đây là mức giảm 80% ở cả hai chiều.

GPT-5.6 Terra giảm từ 2,50 USD xuống 2 USD cho một triệu token đầu vào và từ 15 USD xuống 12 USD cho một triệu token đầu ra, tương đương mức giảm 20%. GPT-5.6 Sol vẫn giữ giá Standard là 5 USD đầu vào và 30 USD đầu ra cho mỗi triệu token.

Mô hình

Giá cũ đầu vào

Giá mới đầu vào

Giá cũ đầu ra

Giá mới đầu ra

Mức giảm

GPT-5.6 Luna

1 USD/1M token

0,20 USD/1M token

6 USD/1M token

1,20 USD/1M token

80%

GPT-5.6 Terra

2,50 USD/1M token

2 USD/1M token

15 USD/1M token

12 USD/1M token

20%

GPT-5.6 Sol

5 USD/1M token

5 USD/1M token

30 USD/1M token

30 USD/1M token

Không đổi

Nếu chỉ nhìn vào phần trăm, Terra có vẻ được giảm không nhiều. Tuy nhiên, với hệ thống chạy hàng tỷ token mỗi tháng, chênh lệch 20% có thể trở thành khoản tiết kiệm đáng kể. Luna còn tạo ra thay đổi lớn hơn: nhiều tác vụ trước đây chỉ phù hợp với mô hình mini hoặc mô hình mã nguồn mở giá rẻ nay có thể được chuyển sang cùng một hệ sinh thái GPT-5.6 với chi phí dễ kiểm soát hơn.

Fast mode của GPT-5.6 Sol là gì?

Biểu đồ độ trễ của GPT-5.6 trên bài đánh giá TroubleshootingBench
So sánh độ trễ của các tầng GPT-5.6 trên TroubleshootingBench. Nguồn: OpenAI Deployment Safety.

Cùng với đợt giảm giá, OpenAI giới thiệu lựa chọn xử lý nhanh hơn cho GPT-5.6 Sol trong API. Theo công bố của hãng, Fast mode có tốc độ khoảng 2,5 lần Standard và được tính ở mức 2 lần giá Standard. Fast mode thay thế tên gọi Priority Processing trong API, đồng thời được thiết kế để tương thích với lệnh /fast trong Codex.

Các yêu cầu API cũ đang gắn chế độ priority vẫn tiếp tục hoạt động, nên nhà phát triển không bắt buộc phải sửa hệ thống ngay lập tức. Tuy nhiên, đội ngũ kỹ thuật nên cập nhật tài liệu nội bộ và theo dõi chi phí vì tốc độ cao hơn không đồng nghĩa với chi phí cho mỗi tác vụ luôn tốt hơn.

Fast mode phù hợp với những tình huống mà độ trễ trực tiếp ảnh hưởng đến doanh thu hoặc trải nghiệm người dùng, chẳng hạn agent hỗ trợ khách hàng cao cấp, trợ lý phân tích trong cuộc họp, quy trình xử lý sự cố sản xuất, coding agent đang chặn pipeline triển khai hoặc ứng dụng tương tác thời gian thực. Ngược lại, tác vụ chạy nền, tổng hợp báo cáo qua đêm hoặc xử lý batch thường không cần trả thêm phí chỉ để hoàn thành sớm hơn vài phút.

Người dùng ChatGPT có được giảm giá thuê bao không?

Không. OpenAI xác nhận giá thuê bao ChatGPT và Codex cũng như ngân sách quota của từng gói vẫn giữ nguyên. Điều thay đổi là mức sử dụng của Terra và Luna được tính nhẹ hơn trong ChatGPT Work và Codex. Nói cách khác, số tiền thuê bao hàng tháng không giảm, nhưng cùng một hạn mức có thể phục vụ nhiều phiên làm việc hơn.

Đây là khác biệt quan trọng vì tiêu đề “OpenAI giảm giá GPT-5.6” có thể khiến người dùng phổ thông hiểu rằng ChatGPT Plus, Pro, Business hoặc Enterprise sắp rẻ hơn. Thực tế, lợi ích rõ nhất thuộc về nhà phát triển dùng API và người dùng thường xuyên chạy các tác vụ dài trong Codex hoặc ChatGPT Work.

Ví dụ, một người dùng Codex có thói quen giao nhiều tác vụ sửa code, kiểm tra repository và tạo pull request bằng Terra có thể nhận thấy hạn mức tiêu hao chậm hơn. Người dùng ChatGPT Work xử lý tài liệu, bảng tính, nghiên cứu web hoặc quy trình kết nối nhiều công cụ cũng có thể hoàn thành thêm nhiều đầu việc trước khi chạm quota.

Để hiểu rõ hơn vị trí của ba model trong hệ sinh thái mới, có thể đọc thêm bài GPT-5.6 chính thức ra mắt: Sol, Terra, Luna và bước chuyển từ chatbot sang AI làm việc trên NextGZ.

Vì sao Luna giảm tới 80%?

OpenAI giải thích rằng mức giá mới được hỗ trợ bởi những cải thiện về hiệu suất trong quá trình phát triển GPT-5.6. Dòng model này được tối ưu để hoàn thành công việc với ít token hơn, ít vòng gọi công cụ hơn và thời gian xử lý ngắn hơn. Khi chi phí suy luận trên mỗi tác vụ giảm, hãng có thêm khoảng trống để điều chỉnh giá bán.

Nhưng lý do kinh tế có thể rộng hơn. Thị trường AI năm 2026 đang chuyển từ cuộc đua “mô hình nào thông minh nhất” sang câu hỏi thực dụng hơn: một tác vụ hoàn thành đáng tin cậy thực sự tốn bao nhiêu tiền? Doanh nghiệp không chỉ trả tiền cho token. Họ còn trả cho retry, kiểm tra đầu ra, thời gian chờ, lỗi tool, human review và chi phí vận hành hệ thống điều phối.

Reuters nhận định đợt giảm giá diễn ra trong bối cảnh doanh nghiệp ngày càng soi kỹ hóa đơn AI, đồng thời các phòng lab Mỹ chịu sức ép từ mô hình Trung Quốc và hệ sinh thái open-weight có giá thấp. Khi chất lượng giữa các model tiến gần nhau, giá và độ ổn định trở thành yếu tố quyết định việc một sản phẩm có thể mở rộng đến hàng triệu yêu cầu hay không.

Luna vì thế đóng vai trò chiến lược. OpenAI không cần Luna thắng Sol ở mọi benchmark. Hãng chỉ cần Luna đủ tốt cho phần lớn workload lặp lại, đủ rẻ để thay thế model mini, và đủ tương thích với Responses API, tool calling cùng hạ tầng doanh nghiệp hiện có.

Giảm giá token chưa chắc đồng nghĩa chi phí mỗi tác vụ giảm đúng 80%

Biểu đồ đánh giá tỷ lệ ảo giác và độ chính xác của GPT-5.6
Đánh giá xu hướng ảo giác của GPT-5.6 trong tài liệu an toàn chính thức. Nguồn: OpenAI Deployment Safety.

Đây là điểm các đội ngũ triển khai AI cần đặc biệt lưu ý. Giá token chỉ là một biến trong tổng chi phí. Nếu model rẻ hơn nhưng cần prompt dài hơn, tạo nhiều đầu ra hơn, gọi tool nhiều lần hoặc thường xuyên phải retry, mức tiết kiệm thực tế sẽ thấp hơn con số quảng cáo.

Ngược lại, nếu Luna hoàn thành cùng một tác vụ với số token tương đương và tỷ lệ lỗi không tăng đáng kể, tổng chi phí có thể giảm gần sát 80%. Do đó, quyết định chuyển model cần dựa trên cost per successful task, không chỉ dựa trên bảng giá mỗi triệu token.

Một phép đo thực tế nên bao gồm ít nhất sáu biến: token đầu vào, token đầu ra, số vòng gọi công cụ, thời gian hoàn thành, tỷ lệ phải chạy lại và số phút human review. Với tác vụ sản xuất, cần theo dõi thêm tỷ lệ hoàn thành đúng schema, lỗi bảo mật, lỗi trích dẫn và mức độ ổn định giữa nhiều lần chạy.

Ví dụ chi phí: Luna mới rẻ đến mức nào?

Biểu đồ quan hệ giữa ngân sách token và hiệu suất GPT-5.6
Quan hệ giữa ngân sách token và hiệu suất GPT-5.6 trong bài đánh giá CTF. Nguồn: OpenAI Deployment Safety.

Giả sử một hệ thống hỗ trợ nội dung xử lý 10 triệu token đầu vào và tạo 2 triệu token đầu ra mỗi ngày. Với giá Luna cũ, chi phí lý thuyết là 10 USD cho đầu vào cộng 12 USD cho đầu ra, tổng 22 USD mỗi ngày. Với giá mới, chi phí còn 2 USD đầu vào cộng 2,40 USD đầu ra, tổng 4,40 USD mỗi ngày.

Nếu workload ổn định trong 30 ngày, chi phí token giảm từ khoảng 660 USD xuống 132 USD, tiết kiệm 528 USD mỗi tháng. Với quy mô lớn hơn gấp 100 lần, khoản chênh lệch có thể lên tới hàng chục nghìn USD.

Tuy nhiên, con số trên chưa tính cache, batch, long context, tool execution, hạ tầng riêng và chi phí kiểm duyệt. Nó chỉ minh họa tác động của bảng giá mới trong trường hợp khối lượng token không đổi.

Với Terra, cùng workload 10 triệu token đầu vào và 2 triệu token đầu ra sẽ giảm từ 55 USD xuống 44 USD mỗi ngày. Mức tiết kiệm tuyệt đối 11 USD mỗi ngày không gây ấn tượng ở một dự án nhỏ, nhưng trở nên đáng kể khi chạy trên nhiều sản phẩm, nhiều thị trường và hàng nghìn phiên agent đồng thời.

Nên dùng GPT-5.6 Luna cho công việc nào?

Luna phù hợp nhất với tác vụ khối lượng lớn, có cấu trúc rõ, dễ kiểm tra và không đòi hỏi suy luận sâu ở mọi lượt. Các use case điển hình gồm phân loại nội dung, trích xuất dữ liệu, chuẩn hóa metadata, gắn nhãn ticket, tóm tắt cuộc hội thoại, phát hiện trường thiếu trong biểu mẫu, tạo biến thể nội dung ngắn, chuyển đổi định dạng và hỗ trợ tìm kiếm nội bộ.

Với website nội dung, Luna có thể xử lý bước tiền biên tập như bóc tách thực thể, đề xuất tag, phát hiện đoạn trùng, tạo mô tả ảnh ban đầu, phân loại ý định tìm kiếm hoặc kiểm tra cấu trúc schema. Con người hoặc model mạnh hơn vẫn nên phụ trách phần quyết định biên tập, kiểm chứng tin và xuất bản.

Luna cũng phù hợp làm model tuyến đầu trong kiến trúc routing. Hệ thống có thể gửi yêu cầu đơn giản sang Luna, sau đó nâng lên Terra hoặc Sol khi phát hiện độ phức tạp cao, thiếu tự tin, nhiều tool call hoặc rủi ro lớn. Cách này thường hiệu quả hơn việc chạy toàn bộ lưu lượng qua model mạnh nhất.

Khi nào Terra là lựa chọn hợp lý hơn?

Biểu đồ hiệu suất GPT-5.6 trong bài đánh giá Capture the Flag
Hiệu suất các biến thể GPT-5.6 trong bài đánh giá Capture the Flag. Nguồn: OpenAI Deployment Safety.

Terra được OpenAI định vị là model cân bằng cho công việc hàng ngày. Sau khi giảm 20%, nó trở nên hấp dẫn cho những hệ thống cần chất lượng ổn định hơn Luna nhưng chưa đủ lý do để trả giá Sol.

Terra phù hợp với agent hỗ trợ khách hàng có quyền truy cập dữ liệu doanh nghiệp, soạn thảo báo cáo, phân tích tài liệu nhiều bước, coding task mức trung bình, tạo nội dung cần bám guideline, tổng hợp thông tin từ nhiều nguồn và workflow có tool calling. Nó cũng là ứng viên tốt cho “default model” trong các sản phẩm SaaS, miễn là đội ngũ có eval riêng.

Điểm đáng chú ý là một số benchmark của GPT-5.6 cho thấy Terra giữ được phần lớn năng lực của Sol trong khi chi phí thấp hơn đáng kể. Nhưng benchmark tổng hợp không thể thay thế kiểm thử trên dữ liệu thật. Một model có điểm coding cao chưa chắc tuân thủ tốt schema nội bộ, hiểu đúng thuật ngữ ngành hoặc tạo câu trả lời phù hợp với khách hàng Việt Nam.

Khi nào vẫn nên trả tiền cho Sol?

Sol nên được dành cho các tác vụ mà chất lượng sai lệch một chút có thể tạo ra chi phí lớn hơn tiền token: tái cấu trúc codebase phức tạp, điều tra lỗi sản xuất, nghiên cứu chuyên sâu, phân tích hợp đồng có kiểm soát, thiết kế kiến trúc hệ thống, lập kế hoạch nhiều bước hoặc agent cần làm việc lâu qua nhiều công cụ.

Sol cũng phù hợp khi yêu cầu không rõ ràng và model phải tự xây dựng chiến lược, kiểm tra giả thuyết, phản biện kết quả rồi sửa lại đầu ra. Với những tác vụ như vậy, dùng model rẻ nhưng thất bại nhiều lần có thể đắt hơn chạy Sol một lần.

Fast mode của Sol nên là lớp ưu tiên cuối cùng, chỉ bật khi độ trễ có giá trị kinh doanh rõ ràng. Một pipeline tốt có thể dùng Luna để phân loại, Terra để xử lý phần chính, Sol để giải quyết trường hợp khó và Sol Fast cho tình huống khẩn cấp.

Đợt giảm giá ảnh hưởng thế nào đến Codex?

Biểu đồ GPT-5.6 trên bài đánh giá bảo mật phần mềm SEC-bench Pro
Kết quả GPT-5.6 trên SEC-bench Pro, một đánh giá liên quan đến bảo mật phần mềm. Nguồn: OpenAI Deployment Safety.

Codex là một trong những sản phẩm hưởng lợi trực tiếp vì coding agent thường tiêu thụ lượng token lớn trong các phiên dài: đọc repository, lập kế hoạch, tìm file liên quan, chỉnh sửa, chạy test, đọc log và lặp lại. Khi Terra và Luna tiêu hao ít credits hơn, người dùng có thể giao thêm việc trong cùng ngân sách.

Nhưng coding agent không nên được tối ưu chỉ bằng cách chọn model rẻ nhất. Repository lớn có thể khiến số vòng thử sai tăng nhanh. Cần đo tỷ lệ test pass, số file sửa ngoài phạm vi, số lần agent hiểu sai yêu cầu, thời gian review và khả năng rollback.

Đặc biệt, GPT-5.6 System Card cho thấy các model mới có năng lực agent và cybersecurity cao hơn, đồng thời OpenAI vẫn khuyến nghị giám sát những quỹ đạo coding dài. Chi phí giảm giúp mở rộng sử dụng, nhưng cũng làm tăng nhu cầu kiểm soát quyền, sandbox, approval gate và nhật ký thay đổi.

NextGZ từng phân tích trường hợp agent vượt giới hạn môi trường trong bài OpenAI tạm dừng mô hình AI chạy dài vì vượt sandbox. Bài học vẫn còn nguyên giá trị: model rẻ hơn không có nghĩa là có thể cấp quyền rộng hơn.

Ảnh hưởng đến ChatGPT Work và doanh nghiệp nhỏ

Trong ChatGPT Work, Terra và Luna được dùng cho nhiều loại tác vụ kết nối dữ liệu, xử lý tài liệu và điều phối công việc. Việc tính usage nhẹ hơn có thể giúp đội ngũ nhỏ tận dụng agent thường xuyên hơn mà không tăng gói thuê bao.

Một doanh nghiệp có thể dùng Luna cho phân loại email, chuẩn hóa lead, cập nhật CRM và tạo bản tóm tắt; dùng Terra cho đề xuất trả lời, phân tích cơ hội và lập báo cáo; dùng Sol cho chiến lược, nghiên cứu thị trường hoặc xử lý ngoại lệ. Đây là mô hình vận hành thực tế hơn so với việc yêu cầu nhân viên tự chọn model theo cảm tính.

Để triển khai, doanh nghiệp nên xây dựng ma trận workload gồm độ phức tạp, rủi ro, yêu cầu latency, giới hạn chi phí và điều kiện escalation. Nội dung về lộ trình ứng dụng có thể tham khảo thêm tại bài OpenAI ra mắt chương trình ChatGPT cho doanh nghiệp nhỏ.

Cuộc chiến AI đang chuyển sang hiệu suất trên mỗi USD

Biểu đồ hiệu suất GPT-5.6 trong bài đánh giá an ninh mạng ExploitGym
Kết quả GPT-5.6 trên ExploitGym trong tài liệu an toàn của OpenAI. Nguồn: OpenAI Deployment Safety.

Trong giai đoạn đầu của làn sóng generative AI, thị trường chủ yếu so sánh benchmark, context window và những demo gây ấn tượng. Đến năm 2026, câu hỏi quan trọng hơn là liệu model có thể hoàn thành khối lượng công việc thật với chi phí, tốc độ và độ ổn định đủ tốt hay không.

Đợt giảm giá của OpenAI tạo sức ép lên Anthropic, Google, xAI và các nhà cung cấp model Trung Quốc. Khi một model nhỏ hơn đạt chất lượng gần model cao cấp ở nhiều tác vụ, nhà cung cấp không thể chỉ bán “trí thông minh tối đa”; họ phải cung cấp hệ thống routing, cache, batch, tool calling, quan sát chi phí và cam kết vận hành.

Với khách hàng, cạnh tranh này có lợi nhưng cũng khiến việc so sánh phức tạp hơn. Giá niêm yết không phản ánh đầy đủ prompt caching, long-context multiplier, tốc độ, tỷ lệ lỗi, quota và giá qua cloud partner. Doanh nghiệp cần benchmark trên cùng dữ liệu, cùng giới hạn thời gian và cùng tiêu chí thành công.

Chi phí thấp hơn có làm tăng rủi ro an toàn?

Biểu đồ đánh giá khả năng chống jailbreak của GPT-5.6
Đánh giá khả năng chống jailbreak của GPT-5.6 trong System Card. Nguồn: OpenAI Deployment Safety.

Giảm giá không làm model nguy hiểm hơn về bản chất, nhưng nó giúp cùng một ngân sách chạy được nhiều yêu cầu hơn. Khi năng lực agent, tool use và cybersecurity tăng, quy mô sử dụng lớn hơn đồng nghĩa bề mặt rủi ro cũng rộng hơn.

OpenAI cho biết GPT-5.6 được triển khai với lớp bảo vệ mạnh nhất của hãng tại thời điểm phát hành, gồm huấn luyện an toàn, kiểm tra thời gian thực, giám sát và quyền truy cập theo mức độ tin cậy. Dù vậy, system card cũng nhấn mạnh không có hệ thống nào an toàn tuyệt đối và các điểm yếu mới sẽ tiếp tục được phát hiện.

Đội ngũ triển khai nên giữ bốn nguyên tắc: quyền tối thiểu, xác nhận trước hành động rủi ro, môi trường tách biệt và khả năng khôi phục. Ngoài ra, cần giới hạn ngân sách theo phiên để tránh một agent bị kẹt trong vòng lặp nhưng vẫn tiếp tục tiêu thụ token chỉ vì giá mỗi token đã rẻ.

Chiến lược routing đề xuất cho đội ngũ Việt Nam

Biểu đồ đánh giá khả năng kiểm soát chuỗi suy luận của GPT-5.6
Khả năng kiểm soát hành vi suy luận của GPT-5.6 trong đánh giá chính thức. Nguồn: OpenAI Deployment Safety.

Một cấu hình khởi đầu thực dụng là dùng Luna cho khoảng 60–80% yêu cầu đơn giản, Terra cho 15–35% yêu cầu cần reasoning và Sol cho nhóm ngoại lệ có giá trị cao. Tỷ lệ thực tế phải được điều chỉnh bằng dữ liệu, không nên sao chép máy móc.

  1. Bước 1: Chia workload theo loại công việc thay vì theo phòng ban. Ví dụ: trích xuất, phân loại, soạn thảo, nghiên cứu, coding, hành động có quyền ghi.

  2. Bước 2: Xây bộ eval gồm dữ liệu thật đã ẩn thông tin nhạy cảm. Chấm cả chất lượng, latency, token, retry và human review.

  3. Bước 3: Chọn Luna làm baseline cho tác vụ dễ. Chỉ nâng lên Terra khi Luna không đạt ngưỡng.

  4. Bước 4: Dùng Sol cho trường hợp khó hoặc khi chi phí sai sót cao hơn nhiều so với tiền model.

  5. Bước 5: Thiết lập routing động dựa trên độ dài ngữ cảnh, số tool, độ tự tin, loại dữ liệu và mức rủi ro.

  6. Bước 6: Theo dõi cost per successful task theo tuần; không chỉ xem tổng token.

Với nội dung tiếng Việt, cần bổ sung tiêu chí về giọng văn, thuật ngữ ngành, tên riêng, dấu câu và khả năng giữ nguyên dữ kiện. Một model rẻ có thể đạt điểm tổng tốt nhưng vẫn tạo nhiều lỗi biên tập nhỏ, làm mất thời gian sửa thủ công.

Những hiểu lầm phổ biến về đợt giảm giá

“ChatGPT Plus sắp giảm 80%”

Sai. Mức giảm 80% áp dụng cho giá API của GPT-5.6 Luna. Thuê bao ChatGPT không giảm 80%.

“Luna rẻ hơn nên luôn là lựa chọn tốt nhất”

Không đúng. Luna phù hợp với workload đơn giản và có thể kiểm tra. Tác vụ phức tạp có thể tốn nhiều lần retry, khiến tổng chi phí cao hơn Terra hoặc Sol.

“Terra giảm ít nên không đáng quan tâm”

Không chính xác. Terra có thể là model mặc định của nhiều sản phẩm. Giảm 20% trên lưu lượng lớn tạo ra khoản tiết kiệm đáng kể mà không cần thay đổi kiến trúc.

“Fast mode rẻ hơn vì hoàn thành nhanh hơn”

Fast mode tính giá cao hơn Standard. Nó chỉ đáng dùng khi thời gian tiết kiệm được có giá trị lớn hơn phần chi phí tăng thêm.

“Giá token thấp là đủ để chọn nhà cung cấp”

Không. Cần tính chất lượng đầu ra, retry, cache, tool call, latency, độ ổn định, bảo mật, data residency và chi phí chuyển đổi.

Doanh nghiệp nên làm gì ngay sau thông báo này?

Nhà phát triển đang dùng Luna hoặc Terra nên cập nhật bảng dự toán chi phí và chạy lại benchmark trên workload thật. Không cần migration model vì tên model không đổi, nhưng nên kiểm tra dashboard, cơ chế budget alert và báo cáo margin.

Đội ngũ đang dùng Sol cho mọi yêu cầu nên thử routing xuống Terra hoặc Luna ở những tác vụ có cấu trúc. Chỉ cần chuyển được một phần lưu lượng mà không giảm chất lượng cũng có thể cải thiện đáng kể biên lợi nhuận.

Người dùng Codex và ChatGPT Work nên xem lại cách lựa chọn model. Các tác vụ lặp lại, ít rủi ro có thể chuyển sang Luna; công việc hàng ngày dùng Terra; nhiệm vụ khó mới dùng Sol. Với Sol Fast, chỉ bật khi thực sự bị giới hạn bởi thời gian.

Cuối cùng, hãy ghi lại baseline trước khi thay đổi. Nếu không có dữ liệu về chi phí và tỷ lệ thành công hiện tại, đội ngũ sẽ khó biết đợt giảm giá mang lại lợi ích thật hay chỉ khiến số lượng yêu cầu tăng lên.

Câu hỏi thường gặp

Giá mới của GPT-5.6 Luna là bao nhiêu?

0,20 USD cho một triệu token đầu vào và 1,20 USD cho một triệu token đầu ra theo chế độ Standard API.

Giá mới của GPT-5.6 Terra là bao nhiêu?

2 USD cho một triệu token đầu vào và 12 USD cho một triệu token đầu ra.

GPT-5.6 Sol có giảm giá không?

Giá Standard không đổi. OpenAI bổ sung Fast mode với tốc độ khoảng 2,5 lần và mức giá bằng 2 lần Standard.

ChatGPT Plus, Pro hay Business có giảm giá không?

Không. OpenAI cho biết giá thuê bao và ngân sách quota không đổi. Terra và Luna chỉ tiêu thụ ít usage hơn trong một số trải nghiệm như ChatGPT Work và Codex.

Khi nào nên chuyển từ Sol sang Terra hoặc Luna?

Khi tác vụ có cấu trúc rõ, dễ kiểm tra và không cần mức reasoning cao nhất. Việc chuyển model nên được xác nhận bằng eval trên dữ liệu thật.

Giá mới đã áp dụng trên AWS chưa?

OpenAI cho biết thay đổi bắt đầu được triển khai trên AWS trong ngày công bố. Tình trạng thực tế có thể khác nhau theo khu vực và nhà cung cấp, vì vậy cần kiểm tra bảng giá tại thời điểm sử dụng.

Kết luận

Việc giảm 80% giá GPT-5.6 Luna và 20% giá Terra là tín hiệu rõ ràng rằng cuộc đua AI đang bước sang giai đoạn tối ưu kinh tế trên mỗi tác vụ. OpenAI muốn đưa nhiều workload hơn vào cùng một gia đình model, từ xử lý khối lượng lớn đến agent chuyên sâu, thay vì để khách hàng phải chọn giữa một model cao cấp đắt đỏ và các giải pháp giá rẻ bên ngoài hệ sinh thái.

Với người dùng ChatGPT, thay đổi này không làm giá thuê bao thấp hơn nhưng có thể giúp hạn mức đi xa hơn. Với nhà phát triển API, tác động trực tiếp hơn: những ứng dụng từng khó mở rộng vì chi phí đầu ra nay có thể tính lại mô hình kinh doanh. Với doanh nghiệp, cơ hội lớn nhất không nằm ở việc chuyển toàn bộ sang model rẻ nhất, mà ở khả năng xây dựng routing thông minh giữa Luna, Terra và Sol.

Giá model đã thay đổi. Bước tiếp theo là thay đổi cách đo lường: từ chi phí mỗi triệu token sang chi phí cho một công việc hoàn thành đúng, an toàn và đủ chất lượng.

© Tuyên bố bản quyền
THE END
Thích thì ủng hộ nhé.
Thích3 Chia sẻ
bình luận Bình luận đầu tiên

Vui lòng đăng nhập để bình luận

    Chưa có bình luận