Google DeepMind phát hành Gemini 3.7 Flash ngày 13/08, chỉ ba tuần sau Gemini 3.6 Flash, tập trung vào lập trình, tác vụ agent và xử lý tài liệu. Giá giới thiệu đến hết 31/12/2026 là 0,75 USD mỗi triệu token input và 3,75 USD mỗi triệu token output, sau đó tăng lên gấp đôi.
💡 Nhịp ra model của Google giờ tính bằng tuần chứ không phải quý, và Logan Kilpatrick nói phần lớn mức tăng đến từ cải tiến thuật toán chứ không phải thêm compute. Với giá bằng khoảng một nửa thế hệ trước, đây là lựa chọn đáng cân nhắc cho các pipeline agent chạy khối lượng lớn.
- Ra mắt 13/08, chỉ ba tuần sau Gemini 3.6 Flash.
- Google nói vượt model tương đương của Anthropic và OpenAI trên chín benchmark.
- Giá giới thiệu 0,75 và 3,75 USD mỗi triệu token, hết hạn 31/12/2026.
- Sau đó tăng lên 1,50 và 7,50 USD mỗi triệu token.
- Có mặt ngay trong API, AI Studio, Antigravity và GitHub Copilot.
Ba tuần giữa hai bản Flash là con số đáng chú ý hơn cả benchmark. Nó nói rằng Google đã công nghiệp hóa được quy trình huấn luyện và đánh giá, chứ không còn coi mỗi bản model là một dự án lớn. Với đội kỹ thuật, hệ quả thực tế là bạn không nên hardcode tên model ở đâu cả. Hãy để nó trong config, có lớp adapter, và giữ một bộ eval của riêng bạn trên đúng use case của mình để chạy lại mỗi lần đổi. Về giá, 0,75 USD mỗi triệu token input là mức đủ rẻ để chạy các pipeline xử lý tài liệu quy mô lớn, nhưng nhớ rằng đây là giá giới thiệu và sẽ tăng gấp đôi từ tháng 1. Nếu bạn xây mô hình chi phí cho một sản phẩm chạy sang năm, hãy tính bằng giá 1,50 chứ đừng tính bằng 0,75. Còn về việc Google tuyên bố thắng chín benchmark, mình khuyên nên coi đó là tín hiệu tham khảo. Benchmark do chính nhà sản xuất chọn thì luôn đẹp; thứ quyết định là nó chạy thế nào trên dữ liệu và prompt của bạn.