Thị trường Trí tuệ Nhân tạo (AI) vừa chứng kiến những động thái cạnh tranh khốc liệt từ hai “ông lớn” OpenAI và Google. Trong khi OpenAI công bố giảm giá mạnh mẽ cho dòng mô hình GPT-5.6 và ra mắt chế độ Fast Mode, Google cũng chính thức đưa Gemini 3.6 Flash và phiên bản siêu nhẹ 3.5 Flash-Lite lên Gemini API. Cùng tìm hiểu chi tiết các bản cập nhật này và ý nghĩa của chúng đối với các nhà phát triển.
Nội dung
1. OpenAI: Tối ưu chi phí và tốc độ với bản cập nhật GPT-5.6

Theo thông báo mới nhất qua email, OpenAI đang triển khai kế hoạch biến GPT-5.6 thành một công cụ AI giá cả phải chăng và có tốc độ xử lý nhanh hơn. Động thái này nhắm trực tiếp vào nhu cầu triển khai AI quy mô lớn của các doanh nghiệp.
Chi tiết các nâng cấp của GPT-5.6:
- GPT-5.6 Luna giảm 80% chi phí: Luna hiện là mô hình nhanh nhất và có giá thành phải chăng nhất của OpenAI. Mức giá mới vô cùng hấp dẫn: chỉ $0.20 cho mỗi 1 triệu token đầu vào (input tokens) và $1.20 cho mỗi 1 triệu token đầu ra (output tokens).
- Hiệu năng vượt trội của Luna: Mô hình này được xây dựng chuyên biệt để sử dụng các công cụ và quy trình làm việc nhiều bước (multi-step workflows) ở quy mô lớn. OpenAI khẳng định Luna mang lại hiệu suất tương đương với các mô hình AI tiên tiến nhất (frontier-class) của một năm trước, nhưng chi phí chỉ bằng khoảng 6% cho mỗi tác vụ và tốc độ nhanh hơn gần 9 lần.
- GPT-5.6 Terra: Nhận mức giảm giá 20%.
- GPT-5.6 Sol – Ra mắt tính năng Fast mode: Khách hàng sử dụng API giờ đây có thêm tùy chọn “Fast mode” để có thể truy cập nhanh hơn vào mô hình GPT-5.6 Sol.
2. Google: Trình làng Gemini 3.6 Flash và Gemini 3.5 Flash-Lite
Không hề kém cạnh, Google đã chính thức thông báo việc phát hành rộng rãi (generally available) hai mô hình mới trên Gemini API cho các môi trường sản xuất (production environments).

Gemini 3.6 Flash (gemini-3.6-flash)
Phiên bản 3.6 Flash mang đến những cải tiến đáng kể so với người tiền nhiệm 3.5 Flash:
- Hiệu năng và chất lượng: Tiết kiệm token hơn 17%, đồng thời cung cấp chất lượng đầu ra tốt hơn. Mô hình này được tối ưu hóa cho việc điều phối nhiều bước (multi-step orchestration), tạo mã nguồn full-stack (full-stack code generation) và khả năng suy luận tổng quát.
- Chính sách giá mới (Reduced pricing): Chi phí cho token đầu ra đã được hạ xuống chỉ còn $7.50/1 triệu token (so với mức giá cũ là $9.00/1M của bản 3.5 Flash). Chi phí token đầu vào vẫn được duy trì ở mức $1.50/1 triệu token.
Gemini 3.5 Flash-Lite
Đây được xem là mô hình thuộc dòng 3.5 nhanh nhất và tiết kiệm chi phí nhất của Google.
Mức giá của mô hình Gemini 3.5 Flash-Lite trên Gemini API hiện được áp dụng như sau:
- Token đầu vào (Input tokens): 0.30 USD / 1 triệu token.
- Token đầu ra (Output tokens): 2.50 USD / 1 triệu token.
Bên cạnh đó, Google cũng cung cấp các mức giá tối ưu hơn cho một số tùy chọn sử dụng cụ thể:
- Xử lý hàng loạt (Batch API): Giảm một nửa chi phí, chỉ còn 0.15 USD/1M token đầu vào và 1.25 USD/1M token đầu ra.
- Đọc bộ nhớ đệm (Cache read): 0.03 USD / 1 triệu token.
Với mức chi phí này, Gemini 3.5 Flash-Lite định vị là một mô hình cực kỳ tiết kiệm, rất lý tưởng để triển khai các hệ thống AI tự động hóa nhiều bước (agentic workflows) hoặc xử lý dữ liệu khối lượng lớn cần tốc độ phản hồi nhanh.
Kết luận
Sự ra mắt đồng thời của các bản cập nhật GPT-5.6 từ OpenAI và dòng Gemini Flash mới từ Google cho thấy xu hướng rõ nét của ngành công nghiệp AI hiện tại: tối ưu hóa chi phí và tăng tốc độ suy luận. Các nhà phát triển giờ đây có thêm rất nhiều lựa chọn mạnh mẽ, tiết kiệm để xây dựng các ứng dụng AI phức tạp (multi-step và agentic workflows) ở quy mô lớn.
Tìm hiểu thêm: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/







0 Lời bình