Google DeepMind phát hành cùng lúc ba model hướng tới agent chạy ở quy mô production: Gemini 3.6 Flash (chủ lực), 3.5 Flash-Lite (tối ưu chi phí) và 3.5 Flash Cyber (chuyên bảo mật). Bản 3.6 Flash giữ context 1 triệu token, dời knowledge cutoff sang tháng 3/2026 và dùng ít hơn khoảng 17% output token so với 3.5 Flash trong khi điểm coding, long-context và computer-use đều cao hơn.
💡 Vì sao đáng chú ý: cắt 17% output token nghĩa là cùng một workload agent, hóa đơn API giảm thật chứ không phải giảm trên giấy. Đây là lần đầu Google công khai xác nhận Gemini 4 đang chạy pre-training.
- Ba model ra cùng ngày 21/07: 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber.
- Giá 3.6 Flash: 1,50 USD input và 7,50 USD output cho mỗi 1 triệu token.
- Giảm khoảng 17% output token so với 3.5 Flash ở cùng tác vụ.
- Có mặt ngay ngày đầu trên AI Studio, Gemini API và app Gemini.
- Google nói đợt pre-training Gemini 4 là tham vọng nhất từ trước đến nay.
Điểm đáng đọc kỹ ở bản này không phải benchmark, mà là con số 17% output token. Với agent chạy vòng lặp dài, output token là phần đắt nhất và cũng là phần khó dự toán nhất — giảm 17% ở tầng model tương đương giảm chi phí vận hành mà không phải viết lại prompt hay đổi kiến trúc. Đội nào đang chạy Flash-tier cho RAG hoặc tóm tắt hàng loạt nên benchmark lại chi phí thực tế trước khi gia hạn hợp đồng quý sau. Bản Flash-Lite là tín hiệu rõ ràng hơn: Google đang phân tầng giá theo tác vụ chứ không bán một model cho mọi việc, và đó là hướng đúng cho doanh nghiệp Việt vốn nhạy giá. Việc knowledge cutoff nhích lên tháng 3/2026 giúp bớt phải nhồi context cho các câu hỏi về sự kiện gần, nhưng đừng vì thế mà bỏ RAG — dữ liệu nội bộ vẫn không nằm trong cutoff nào cả. Cuối cùng, câu "đã bắt đầu pre-training Gemini 4" là cách Google giữ chỗ trong đầu khách hàng đang cân nhắc ký hợp đồng dài hạn với đối thủ.