Gemini 3.6 Flash Ra Mắt: Giá API, Benchmark, Tính Năng Và So Sánh Toàn Diện

Gemini 3.6 Flash Ra Mắt: Giá API, Benchmark, Tính Năng Và So Sánh Toàn Diện

Gemini 3.6 Flash ra mắt: Giá API, benchmark, tính năng và so sánh toàn diện

Google vừa đưa Gemini 3.6 Flash ra thị trường vào ngày 21/7/2026, nhưng đây không đơn thuần là một bản tăng số phiên bản. Thay đổi đáng chú ý nhất nằm ở cách model hoàn thành công việc: dùng ít token đầu ra hơn, giảm số vòng suy luận và lần gọi công cụ, viết mã chính xác hơn, đồng thời hạ giá output so với Gemini 3.5 Flash.

HNwoi28W8AE97NR

Với người dùng phổ thông, Gemini 3.6 Flash là model mới xuất hiện trong ứng dụng Gemini. Với nhà phát triển và doanh nghiệp, ý nghĩa lớn hơn nằm ở trạng thái Generally Available, model ID ổn định gemini-3.6-flash, cửa sổ ngữ cảnh một triệu token và bộ công cụ phục vụ agent đã đủ để triển khai production.

Bài công bố trên tài khoản Google AI Studio nhanh chóng thu hút sự chú ý vì Google phát hành Gemini 3.6 Flash trước khi Gemini 3.5 Pro sẵn sàng. Điều này cho thấy cuộc đua AI năm 2026 không chỉ xoay quanh model mạnh nhất, mà còn chuyển sang câu hỏi thực tế hơn: model nào hoàn thành được nhiều công việc nhất với chi phí, độ trễ và số lần gọi công cụ thấp nhất?

Gemini 3.6 Flash chính thức ra mắt ngày 21/7/2026

Trong thông báo chính thức ngày 21/7, Google giới thiệu đồng thời Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber. Ba model có mục tiêu khác nhau, nhưng đều phản ánh một ưu tiên chung: tăng hiệu quả cho các hệ thống AI agent chạy ở quy mô lớn.

Gemini 3.6 Flash được Google gọi là model “workhorse”, tức model chủ lực cho những workload cần cân bằng giữa trí tuệ, tốc độ và chi phí. Nó được xây trực tiếp từ phản hồi của nhà phát triển và khách hàng sử dụng Gemini 3.5 Flash, tập trung vào coding, knowledge work, xử lý đa phương thức và quy trình nhiều bước có gọi công cụ.

Model đã ở trạng thái GA, không phải preview. Nhà phát triển có thể dùng ngay qua Gemini API trong Google AI Studio, Android Studio và Google Antigravity. Doanh nghiệp có thể truy cập qua Gemini Enterprise Agent Platform và ứng dụng Gemini Enterprise. Người dùng phổ thông cũng có thể chọn model trong ứng dụng Gemini.

Thông số Gemini 3.6 Flash đầy đủ

Hạng mục

Thông tin

Model ID

gemini-3.6-flash

Trạng thái

Generally Available, sẵn sàng cho production

Dữ liệu đầu vào

Văn bản, hình ảnh, video, âm thanh và PDF

Dữ liệu đầu ra

Văn bản

Giới hạn đầu vào

1.048.576 token

Giới hạn đầu ra

65.536 token

Thinking mặc định

medium

Giá Standard

1,50 USD/1 triệu token input, 7,50 USD/1 triệu token output

Model caching

Có hỗ trợ

Code execution

Có hỗ trợ

Computer Use

Có hỗ trợ ở trạng thái Preview

Function calling

Có hỗ trợ

File Search

Có hỗ trợ

Google Search và Maps grounding

Có hỗ trợ

Structured outputs

Có hỗ trợ

URL Context

Có hỗ trợ

Image generation

Không hỗ trợ

Audio generation

Không hỗ trợ

Live API

Không hỗ trợ

Thông số trên cho thấy Gemini 3.6 Flash là model hiểu đa phương thức nhưng chỉ xuất văn bản. Nó có thể đọc ảnh, video, âm thanh, PDF và kết hợp các nguồn dữ liệu đó trong cùng một yêu cầu, nhưng không phải model tạo ảnh hoặc hội thoại âm thanh thời gian thực.

HNwo7c1a8AA5h9d

Điểm mới quan trọng nhất: ít token và ít vòng lặp hơn

Google cho biết Gemini 3.6 Flash sử dụng ít hơn 17% token đầu ra so với Gemini 3.5 Flash trên Artificial Analysis Index. Trong một số phép đo chuyên về coding agent như DeepSWE của DataCurve, mức giảm token có thể lên tới 65%.

Giảm token không chỉ giúp hóa đơn thấp hơn. Trong một agent nhiều bước, mỗi đoạn đầu ra có thể trở thành dữ liệu đầu vào cho bước tiếp theo. Model càng dài dòng, hệ thống càng phải chuyển nhiều token qua lại, tốn thêm thời gian, context và chi phí. Khi Gemini 3.6 Flash hoàn thành cùng mục tiêu với ít lượt suy luận, ít conversational turn và ít tool call hơn, toàn bộ pipeline có thể trở nên gọn hơn.

Đây là thay đổi đặc biệt quan trọng với những quy trình như đọc repository, tìm lỗi, chỉnh mã, chạy kiểm thử, mở trình duyệt, thu thập dữ liệu rồi tổng hợp báo cáo. Chi phí thực tế của agent không chỉ được quyết định bởi đơn giá token, mà còn bởi số vòng lặp model cần để đi đến kết quả cuối cùng.

Benchmark Gemini 3.6 Flash so với Gemini 3.5 Flash

Bảng so sánh benchmark Gemini 3.6 Flash và Gemini 3.5 Flash trên DeepSWE, MLE Bench, OSWorld-Verified và GDPval-AA v2.
Gemini 3.6 Flash vượt 3.5 Flash trên các benchmark coding agent, nghiên cứu máy học, computer use và knowledge work. Đồ họa: NextGZ, dữ liệu: Google.

Trong nhóm benchmark Google công bố, Gemini 3.6 Flash đều cao hơn model tiền nhiệm ở coding agent, nghiên cứu máy học, sử dụng máy tính và knowledge work.

Benchmark

Gemini 3.6 Flash

Gemini 3.5 Flash

Chênh lệch

DeepSWE

49%

37%

+12 điểm

MLE Bench

63,9%

49,7%

+14,2 điểm

OSWorld-Verified

83,0%

78,4%

+4,6 điểm

GDPval-AA v2

1.421

1.349

+72 điểm

DeepSWE phản ánh khả năng làm việc trong quy trình coding agent. MLE Bench tập trung vào nghiên cứu machine learning. OSWorld-Verified đo khả năng thao tác máy tính trong môi trường gần với thực tế. GDPval-AA v2 đánh giá nhóm công việc tri thức như phân tích tài liệu, dữ liệu và soạn báo cáo.

Các benchmark không bảo đảm mọi dự án đều cải thiện theo đúng tỷ lệ này. Repository, framework, bộ công cụ, prompt và tiêu chuẩn đầu ra có thể làm kết quả thay đổi đáng kể. Cách đánh giá đáng tin cậy nhất vẫn là chạy cùng một tập tác vụ thật trên Gemini 3.5 Flash và 3.6 Flash, sau đó đo tỷ lệ hoàn thành, số lượt sửa, số tool call, tổng token và chi phí cuối cùng.

Gemini 3.6 Flash viết code tốt hơn ở điểm nào?

Google mô tả Gemini 3.6 Flash có độ chính xác cao hơn, ít chỉnh sửa ngoài phạm vi yêu cầu và giảm vòng lặp thực thi. Đây là ba điểm thường gây tốn thời gian khi sử dụng coding agent.

Model cũ có thể sửa đúng một lỗi nhưng đồng thời thay đổi format, cấu trúc file hoặc đoạn code không liên quan. Khi phạm vi chỉnh sửa lan rộng, người dùng phải kiểm tra diff nhiều hơn và rủi ro regression tăng. Gemini 3.6 Flash được tối ưu để bám sát chẩn đoán, giữ phạm vi thay đổi hẹp hơn và giảm những vòng “sửa rồi phá, phá rồi sửa”.

Model cũng có xu hướng chạy script chẩn đoán trước khi chỉnh mã. Với lỗi phức tạp, cách tiếp cận này giúp thu thập bằng chứng rồi mới thay đổi hệ thống. Tuy nhiên, tài liệu nhà phát triển của Google lưu ý rằng nó có thể tạo thêm bước khám phá khi xử lý frontend đơn giản.

Một điểm cần nói rõ là code chạy đúng chưa chắc giao diện đẹp hơn. Trong đánh giá của con người, một số model cũ vẫn được ưa thích hơn về bố cục và styling. Khi dùng Gemini 3.6 Flash để dựng giao diện, brief nên quy định rõ design system, khoảng cách, typography, breakpoint, trạng thái tương tác và tiêu chuẩn hình ảnh.

HNwpm GbwAAI708

Khả năng multimodal và spatial reasoning được nâng cấp

Gemini 3.6 Flash nhận văn bản, hình ảnh, video, âm thanh và PDF trong cùng một model. Google nhấn mạnh mức cải thiện ở đọc biểu đồ, phân tích dữ liệu, chuyển blueprint trực quan thành cấu trúc số và tạo layout web có nhiều thành phần.

Với AI Creator, điều này mở ra những workflow thực tế hơn việc chỉ gửi prompt văn bản. Người dùng có thể đưa vào một file PDF nghiên cứu, ảnh chụp giao diện, bảng số liệu, video demo và yêu cầu model tạo bản phân tích thống nhất. Với website, model có thể đọc screenshot giao diện hiện tại, đối chiếu code và đề xuất thay đổi. Với nội dung, model có thể trích thông tin từ biểu đồ hoặc tài liệu dài trước khi xây outline và bài viết.

Dù hiểu hình ảnh tốt hơn, Gemini 3.6 Flash không tạo ảnh. Những nhiệm vụ cần sinh hoặc chỉnh sửa hình ảnh vẫn phải chuyển sang model hình ảnh chuyên dụng trong hệ sinh thái Gemini.

Computer Use trở thành công cụ quan trọng của Gemini API

Gemini 3.6 Flash hỗ trợ Computer Use dưới dạng công cụ gốc ở trạng thái Preview. Thay vì chỉ trả lời hướng dẫn, model có thể tham gia vào agent thao tác giao diện, điều hướng ứng dụng và hoàn thành chuỗi tác vụ trên máy tính.

Trong OSWorld-Verified, model đạt 83,0%, cao hơn 78,4% của Gemini 3.5 Flash. Mức tăng không chỉ liên quan đến khả năng “nhìn màn hình”, mà còn phụ thuộc vào lập kế hoạch, xác định hành động tiếp theo, kiểm tra trạng thái sau mỗi thao tác và phục hồi khi giao diện thay đổi.

Computer Use vẫn cần lớp bảo vệ chặt chẽ. Những hành động như gửi email, xuất bản nội dung, xóa dữ liệu, mua hàng, thay đổi tài khoản hoặc triển khai production nên yêu cầu con người phê duyệt. Model có thể tự động hóa thao tác, nhưng quyền hạn phải được giới hạn theo đúng vai trò.

Gemini 3.6 Flash trở thành model mặc định cho Antigravity agent

Nhờ hiệu năng mới, Gemini 3.6 Flash được dùng làm model mặc định cho Antigravity agent trong Gemini Managed Agents. Đây là tín hiệu quan trọng hơn một benchmark đơn lẻ, bởi Google đang đưa model vào chính hạ tầng agent của mình.

Antigravity có thể làm việc trong môi trường từ xa, sử dụng trình duyệt, đọc nguồn, tạo tài liệu và phối hợp nhiều bước. Khi model nền giảm tool call, giảm token và hạn chế vòng lặp, chi phí của những tác vụ kéo dài có thể giảm đáng kể.

Với doanh nghiệp, lợi ích rõ nhất nằm ở những quy trình lặp lại như nghiên cứu thị trường, tổng hợp tin tức, xử lý tài liệu, kiểm tra dữ liệu, cập nhật catalog hoặc tạo báo cáo. Với nhà phát triển, model phù hợp cho code migration, sửa lỗi, refactor có kiểm soát và tự động hóa kiểm thử.

Giá Gemini 3.6 Flash và mức tiết kiệm thực tế

Ở chế độ Standard, Gemini 3.6 Flash có giá 1,50 USD cho một triệu token đầu vào và 7,50 USD cho một triệu token đầu ra. Giá input giữ nguyên so với Gemini 3.5 Flash, trong khi giá output giảm từ 9 USD xuống 7,50 USD.

Chế độ

Input/1M token

Output/1M token

Context caching

Standard

1,50 USD

7,50 USD

0,15 USD

Batch

0,75 USD

3,75 USD

0,075 USD

Flex

0,75 USD

3,75 USD

0,075 USD

Priority

2,70 USD

13,50 USD

0,27 USD

Nếu một hệ thống tạo 10 triệu token đầu ra mỗi tháng, chỉ riêng thay đổi đơn giá từ 9 USD xuống 7,50 USD đã giảm 15 USD. Con số này chưa tính phần token giảm nhờ model ít dài dòng hơn và ít lặp tool call hơn. Ở quy mô hàng tỷ token, hai lớp tiết kiệm cộng lại mới trở thành khác biệt đáng kể.

Batch và Flex có giá bằng một nửa Standard, phù hợp với workload không yêu cầu phản hồi tức thì. Priority đắt hơn nhưng dành cho hệ thống cần năng lực phục vụ ưu tiên. Bảng giá đầy đủ và các khoản liên quan đến Search hoặc Maps grounding được cập nhật trên trang giá Gemini API.

HNwsB aW4AAJTRA

So sánh Gemini 3.6 Flash, 3.5 Flash và 3.5 Flash-Lite

Bảng chọn Gemini 3.6 Flash, Gemini 3.5 Flash và Gemini 3.5 Flash-Lite theo giá API, mức thinking và nhóm tác vụ phù hợp.
So sánh giá và trường hợp sử dụng Gemini 3.6 Flash, 3.5 Flash và 3.5 Flash-Lite. Đồ họa: NextGZ, dữ liệu: Google AI for Developers.

Model

Giá input/output

Thinking mặc định

Phù hợp nhất

Gemini 3.6 Flash

1,50/7,50 USD

Medium

Coding, multimodal, computer use, agent nhiều bước

Gemini 3.5 Flash

1,50/9,00 USD

Medium

Hệ thống đang ổn định và chưa có điều kiện kiểm thử migration

Gemini 3.5 Flash-Lite

0,30/2,50 USD

Minimal

Phân loại, trích xuất, dịch, routing và xử lý dữ liệu số lượng lớn

Gemini 3.6 Flash là lựa chọn hợp lý khi chất lượng coding, đa phương thức và agent quan trọng hơn mức giá thấp nhất. Gemini 3.5 Flash-Lite phù hợp khi sản phẩm phải xử lý lượng yêu cầu rất lớn nhưng mỗi tác vụ không quá phức tạp. Gemini 3.5 Flash vẫn có thể được giữ lại trong giai đoạn chuyển tiếp nếu hệ thống hiện tại đã ổn định và chưa hoàn tất regression test.

Cả ba model đều hỗ trợ ngữ cảnh một triệu token. Điểm khác biệt lớn nằm ở chất lượng thực thi, mức thinking mặc định, số vòng công cụ và đơn giá đầu ra.

Những thay đổi API có thể làm ứng dụng cũ lỗi

Việc đổi model ID chưa phải toàn bộ quá trình migration. Từ Gemini 3.6 Flash và 3.5 Flash-Lite, Google áp dụng một số thay đổi cho thế hệ API mới.

  • temperaturetop_p và top_k bị deprecated. API hiện bỏ qua các tham số này và các thế hệ sau có thể trả lỗi 400.

  • Không còn hỗ trợ prefilled model turn. Request kết thúc bằng một lượt có role model sẽ bị từ chối.

  • thinking_budget được thay bằng thinking_level. Với Gemini 3.6 Flash, nên dùng medium hoặc high tùy tác vụ.

  • candidate_count không được hỗ trợ trong Gemini 3.x.

  • Cần kiểm tra lại function calling. Đặc biệt với generateContent API, FunctionResponse phải có đúng call_id và name.

Google khuyến nghị sử dụng Interactions API để truy cập các model và tính năng mới nhất. Tài liệu migration Gemini 3.6 Flash có ví dụ Python, JavaScript, REST và checklist thay đổi.

Gemini 3.6 Flash có ý nghĩa gì với AI Creator?

Đối với AI Creator, cải tiến quan trọng nhất không phải model viết thêm được một đoạn văn hay hơn, mà là khả năng vận hành cả chuỗi sản xuất nội dung với ít vòng lặp hơn.

Một workflow có thể bắt đầu bằng việc đọc tài liệu PDF, ảnh, biểu đồ và video; tiếp tục nghiên cứu thông tin có Search grounding; sau đó tạo outline, viết bài, xây kịch bản video, chuẩn hóa metadata và cập nhật website. Khi có Computer Use hoặc function calling, model còn có thể phối hợp với CMS, bảng tính, trình duyệt và kho dữ liệu.

Với người làm website, Gemini 3.6 Flash phù hợp để đọc codebase, phân tích lỗi, xây tính năng, kiểm thử và chuẩn bị diff. Với người làm MMO hoặc affiliate, model có thể trích xuất dữ liệu sản phẩm, phân loại nội dung, so sánh thông số và tạo báo cáo. Với đội marketing, model phù hợp cho phân tích tài liệu, biểu đồ, insight và soạn bản nháp đa định dạng.

Tuy nhiên, model mạnh hơn không thay thế quy trình kiểm chứng. Các bước liên quan đến xuất bản, giá bán, quyền truy cập, thanh toán hoặc thay đổi dữ liệu production vẫn cần tiêu chuẩn đầu ra và cơ chế phê duyệt rõ ràng.

Ai nên chuyển sang Gemini 3.6 Flash ngay?

Những hệ thống đang dùng Gemini 3.5 Flash cho coding agent, xử lý tài liệu đa phương thức, Computer Use hoặc quy trình nhiều tool call nên thử nghiệm sớm. Lợi ích tiềm năng đến từ cả chất lượng cao hơn và chi phí output thấp hơn.

Những ứng dụng có workload đơn giản, khối lượng lớn và nhạy cảm về giá nên so sánh thêm với Gemini 3.5 Flash-Lite. Dùng model mạnh hơn cho mọi request có thể làm mất phần tiết kiệm mà kiến trúc định tuyến model mang lại.

Các hệ thống production quan trọng không nên đổi model chỉ bằng một thay đổi tên. Cần xây bộ regression test gồm những yêu cầu thường gặp, edge case, function calling, structured output, prompt dài và tác vụ có quyền truy cập công cụ. Sau đó mới so sánh chất lượng, latency, token, chi phí và tỷ lệ cần con người sửa.

An toàn và khả năng chống jailbreak

Gemini 3.6 Flash được phát hành với lớp Frontier Safety tăng cường ở các lĩnh vực CBRN và lạm dụng tấn công mạng. Google cho biết model có khả năng chống jailbreak tốt hơn, đồng thời được huấn luyện để giảm từ chối không cần thiết đối với mục đích có lợi.

Đây là bài toán cân bằng khó: model cần ngăn yêu cầu nguy hiểm nhưng không được chặn các hoạt động phòng thủ, nghiên cứu hoặc xử lý dữ liệu hợp pháp. Trong môi trường doanh nghiệp, lớp an toàn của model vẫn phải kết hợp với phân quyền, sandbox, logging, giới hạn công cụ và phê duyệt của con người.

Vì sao Google ra Gemini 3.6 Flash trước Gemini 3.5 Pro?

Gemini 3.5 Pro vẫn đang được thử nghiệm với đối tác và Google chưa công bố ngày phát hành rộng rãi. Trong lúc model flagship tiếp tục hoàn thiện, công ty chọn nâng cấp lớp Flash, nơi có nhu cầu production lớn hơn về chi phí và tốc độ.

Reuters nhận định sự chú ý của thị trường vẫn tập trung vào Gemini 3.5 Pro, nhưng việc Google phát hành ba model nhẹ cho thấy chiến lược cạnh tranh đang nhấn mạnh hiệu quả kinh tế. Google đồng thời xác nhận đã bắt đầu đợt pre-training tham vọng nhất từ trước đến nay cho Gemini 4.

Vì vậy, Gemini 3.6 Flash không phải bản thay thế cho Pro. Nó là model vận hành thực dụng hơn: đủ mạnh để làm coding, knowledge work và agent, nhưng được tối ưu cho chi phí trên mỗi tác vụ hoàn thành.

Gemini 3.6 Flash có đáng nâng cấp không?

Với dữ liệu hiện tại, Gemini 3.6 Flash là một nâng cấp có ý nghĩa so với 3.5 Flash. Model không chỉ tăng điểm benchmark mà còn giải quyết đúng những vấn đề ảnh hưởng trực tiếp đến production: token dài, quá nhiều tool call, chỉnh code lan rộng, vòng lặp thực thi và chi phí output.

Điểm mạnh nhất của model nằm ở coding agent, multimodal analysis, Computer Use và knowledge work. Điểm cần thận trọng là styling giao diện chưa chắc luôn đẹp hơn, API có thay đổi breaking và benchmark không thay thế thử nghiệm nội bộ.

Đối với phần lớn đội ngũ đang dùng Gemini 3.5 Flash, lựa chọn hợp lý là triển khai canary hoặc A/B test với gemini-3.6-flash. Nếu model giảm số vòng sửa, số token và chi phí trên workload thật, việc migration sẽ có giá trị rõ ràng hơn mọi tuyên bố marketing.

© 版权声明
THE END
Thích thì ủng hộ nhé.
点赞1 分享
bình luận 抢沙发

请登录后发表评论

    暂无评论内容