🎬 Video recap tuần — các tin nóng nhất

📌 Tổng quan tuần này

Tuần 33 là tuần tiền và hạ tầng lên tiếng to hơn cả model. Nvidia bắt tay sáu nhà quản lý tài sản lớn nhất Phố Wall để huy động hơn năm trăm tỷ đô cho hạ tầng AI, còn Anthropic ký hợp đồng hai mươi năm trị giá chín phẩy một tỷ đô thuê một trăm chín mươi mốt megawatt từ một công ty vốn đi đào bitcoin. Ở mặt trận model, Meta quay lại con đường mở với Muse Glimmer ba mươi tỷ tham số chạy được trên một GPU tiêu dùng, kèm bài luận sáu nghìn rưỡi chữ của Mark Zuckerberg công kích các phòng lab đóng. Google ra Gemini 3.7 Flash chỉ ba tuần sau bản trước, OpenAI mở GPT-5.6-Cyber cho công việc tấn công mạng có kiểm soát, còn Cerebras đẩy GPT-5.6 Sol lên bảy trăm năm mươi token mỗi giây. Cộng đồng thì tranh cãi dữ dội về một luận điểm khó chịu: AI đang bào mòn tầng lớp giữa của nghề kỹ sư phần mềm.

T2 10/0810
T3 11/083
T4 12/085
T5 13/084
T6 14/080
T7 15/080
CN 16/080

🚀 Mô hình & Sản phẩm mới

🔥 TOP 4 TUẦN NÀY Google ra Gemini 3.7 Flash: rẻ hơn một nửa, nhắm thẳng vào coding và agent

Google DeepMind phát hành Gemini 3.7 Flash ngày 13/08, chỉ ba tuần sau Gemini 3.6 Flash, tập trung vào lập trình, tác vụ agent và xử lý tài liệu. Giá giới thiệu đến hết 31/12/2026 là 0,75 USD mỗi triệu token input và 3,75 USD mỗi triệu token output, sau đó tăng lên gấp đôi.

💡 Nhịp ra model của Google giờ tính bằng tuần chứ không phải quý, và Logan Kilpatrick nói phần lớn mức tăng đến từ cải tiến thuật toán chứ không phải thêm compute. Với giá bằng khoảng một nửa thế hệ trước, đây là lựa chọn đáng cân nhắc cho các pipeline agent chạy khối lượng lớn.

📅 13/08 🔗 Website
  • Ra mắt 13/08, chỉ ba tuần sau Gemini 3.6 Flash.
  • Google nói vượt model tương đương của Anthropic và OpenAI trên chín benchmark.
  • Giá giới thiệu 0,75 và 3,75 USD mỗi triệu token, hết hạn 31/12/2026.
  • Sau đó tăng lên 1,50 và 7,50 USD mỗi triệu token.
  • Có mặt ngay trong API, AI Studio, Antigravity và GitHub Copilot.
NGÀY13/08/2026 INPUT0,75 $/1M OUTPUT3,75 $/1M SAU 31/121,50 / 7,50 $ KHOẢNG CÁCH3 tuần

Ba tuần giữa hai bản Flash là con số đáng chú ý hơn cả benchmark. Nó nói rằng Google đã công nghiệp hóa được quy trình huấn luyện và đánh giá, chứ không còn coi mỗi bản model là một dự án lớn. Với đội kỹ thuật, hệ quả thực tế là bạn không nên hardcode tên model ở đâu cả. Hãy để nó trong config, có lớp adapter, và giữ một bộ eval của riêng bạn trên đúng use case của mình để chạy lại mỗi lần đổi. Về giá, 0,75 USD mỗi triệu token input là mức đủ rẻ để chạy các pipeline xử lý tài liệu quy mô lớn, nhưng nhớ rằng đây là giá giới thiệu và sẽ tăng gấp đôi từ tháng 1. Nếu bạn xây mô hình chi phí cho một sản phẩm chạy sang năm, hãy tính bằng giá 1,50 chứ đừng tính bằng 0,75. Còn về việc Google tuyên bố thắng chín benchmark, mình khuyên nên coi đó là tín hiệu tham khảo. Benchmark do chính nhà sản xuất chọn thì luôn đẹp; thứ quyết định là nó chạy thế nào trên dữ liệu và prompt của bạn.

Cerebras đẩy GPT-5.6 Sol lên 750 token mỗi giây trong tier Ultrafast của OpenAI

OpenAI mở một service tier mới tên Ultrafast, chạy GPT-5.6 Sol trên phần cứng wafer-scale của Cerebras với tốc độ tới 750 token output mỗi giây, nhanh gấp 14 lần chế độ Standard. Trong bài test nội bộ, model trả xong 2.500 câu của Humanity's Last Exam trong 11 giờ 11 phút.

💡 Tốc độ đến từ việc giữ toàn bộ trọng số trong 44 GB SRAM ngay trên chip, bỏ qua nút thắt băng thông bộ nhớ mà GPU phải chịu. Với agent chạy vòng lặp dài, độ trễ mới là chi phí thật, và đây là lần đầu một tier tốc độ cao được bán như sản phẩm chính thức của OpenAI.

📅 13/08 🔗 Website
  • Tới 750 token output mỗi giây, gấp 14 lần chế độ Standard.
  • Chạy trên Wafer-Scale Engine, 44 GB SRAM ngay trên chip.
  • Trả xong 2.500 câu Humanity's Last Exam trong 11 giờ 11 phút.
  • Cerebras nói Claude Fable 5 cần 78 giờ 27 phút cho kết quả tương đương.
  • Mở trước ở API dạng preview giới hạn cho nhóm khách chọn lọc.
TỐC ĐỘ750 tok/s SO VỚI STANDARD×14 SRAM44 GB/chip HLE11h11m NGÀY13/08/2026

Điểm kỹ thuật cốt lõi rất dễ hiểu: GPU phải liên tục kéo trọng số từ bộ nhớ ngoài vào nhân tính toán, và chính đường ống đó là nút thắt. Cerebras làm chip to bằng cả tấm wafer nên nhét được 44 GB SRAM ngay trên chip, trọng số không phải đi đâu cả. Với người dùng cuối, ý nghĩa nằm ở chỗ khác: khi agent chạy vòng lặp mười lăm bước, mỗi bước chờ ba giây thì tổng thời gian mới là thứ giết trải nghiệm, không phải giá token. Con số 11 giờ so với 78 giờ trên Humanity's Last Exam là do Cerebras công bố nên cần đọc có bảo lưu, nhưng hướng đi thì rõ. Với doanh nghiệp Việt Nam, đây chưa phải thứ dùng ngay vì mới là preview giới hạn. Cái đáng làm bây giờ là đo xem trong workflow của bạn, chi phí thật nằm ở token hay ở thời gian chờ. Nếu là thời gian chờ, thì tối ưu prompt để giảm số vòng lặp sẽ có tác dụng ngay, không cần đợi phần cứng mới.

DeepSeek V4 Pro 0813 lên bản chính thức: điểm nhảy vọt nhưng chưa ai kiểm chứng

DeepSeek chốt bản GA cho V4 Pro 0813 ngày 12/08, kết thúc gần bốn tháng preview. Nhà phát triển công bố mức tăng rất lớn ở nhóm coding agent: DeepSWE từ 12,8 lên 62,7, CyberGym từ 52,7 lên 83,3 và Terminal Bench 2.1 từ 72,1 lên 87,9.

💡 Không có blog chính thức, không có trang thông báo, benchmark lan ra từ nhóm WeChat rồi mới tới Reddit và Hacker News, và chưa bên thứ ba nào tái lập được con số. Artificial Analysis chấm model ở mức 53 điểm, tức là khoảng cách giữa con số nhà sản xuất công bố và điểm độc lập vẫn rất đáng ngờ.

📅 12/08 🔗 Website
  • GA ngày 12/08, kết thúc preview kéo dài từ 24/04.
  • DeepSWE nhảy từ 12,8 lên 62,7 so với bản preview.
  • CyberGym từ 52,7 lên 83,3; Terminal Bench 2.1 từ 72,1 lên 87,9.
  • Artificial Analysis Intelligence Index chấm 53 điểm.
  • Không có blog hay trang công bố chính thức từ DeepSeek.
GA12/08/2026 DEEPSWE12,8 → 62,7 CYBERGYM52,7 → 83,3 AA INDEX53 PREVIEW TỪ24/04/2026

Mức tăng gần năm mươi điểm trên DeepSWE là con số nếu đúng thì rất đáng nể, nhưng cách nó được công bố lại là vấn đề. Benchmark đi từ nhóm WeChat sang Reddit rồi thành bảng ASCII trên Hacker News, không có blog, không có model card, không có ai bên ngoài tái lập. Trong ngành này, quy trình công bố cũng là một dạng bằng chứng, và ở đây quy trình gần như không tồn tại. Lời khuyên thực dụng: nếu bạn đang cân nhắc DeepSeek cho pipeline coding agent, đừng ra quyết định dựa trên bảng số này. Hãy lấy đúng hai mươi task thật trong repo của bạn, chạy song song với model hiện tại, đo tỷ lệ pass và số vòng sửa. Mất một buổi chiều nhưng đáng hơn nhiều so với việc tin một bảng số không nguồn. Một điểm nữa cần lưu ý: DeepSeek đã bắt đầu áp giá theo giờ cao điểm và thấp điểm, nên chi phí thực tế của bạn có thể khác xa bảng giá niêm yết tùy múi giờ vận hành.

🔥 TOP 2 TUẦN NÀY Meta mở trọng số Muse Glimmer: model đa phương thức 30B chạy trên một GPU, giấy phép Apache 2.0

Ngày 10/08 Meta phát hành Muse Glimmer, họ model open-weight đa phương thức 30 tỷ tham số theo giấy phép Apache 2.0, tải miễn phí trên Hugging Face và chỉ cần một GPU tiêu dùng để chạy. Model được tối ưu cho tác vụ agent chạy cục bộ như quản lý lịch, sắp xếp file và viết code.

💡 Apache 2.0 nghĩa là dùng thương mại thoải mái, không có điều khoản giới hạn người dùng như các bản Llama cũ. Meta còn tuyên bố sẽ mở luôn trọng số của Muse Spark 1.2, model mạnh nhất của họ, đảo ngược hẳn hướng đóng dần suốt hơn một năm qua.

📅 10/08 🔗 Website
  • 30 tỷ tham số, đa phương thức, giấy phép Apache 2.0.
  • Tải miễn phí trên Hugging Face, chạy trên một GPU tiêu dùng.
  • Tối ưu cho tác vụ agent chạy cục bộ: lịch, file, code.
  • Meta cam kết mở luôn trọng số Muse Spark 1.2.
  • Công bố kèm quỹ 1 tỷ USD cho cộng đồng quanh data center.
THAM SỐ30 tỷ GIẤY PHÉPApache 2.0 PHẦN CỨNG1 GPU tiêu dùng NGÀY10/08/2026 CAPEX 2026tới 145 tỷ $

Chi tiết quan trọng nhất của tin này là giấy phép, không phải số tham số. Apache 2.0 không có điều khoản giới hạn số người dùng hoạt động hàng tháng như các bản Llama trước, nghĩa là doanh nghiệp có thể triển khai thương mại mà không phải đọc lại hợp đồng với luật sư. Với các đội data ở Việt Nam, đây là điểm mở khóa thật sự: rất nhiều khách hàng của mình không hỏi model nào thông minh nhất, họ hỏi dữ liệu có phải rời khỏi hệ thống nội bộ không. Một model 30B chạy trên một card tiêu dùng trả lời được đúng câu đó. Nhưng đừng kỳ vọng nó thay được model frontier cho bài toán suy luận khó; hãy dùng nó cho lớp việc chiếm phần lớn khối lượng thực tế: phân loại, trích xuất, tóm tắt, gọi tool đơn giản, tất cả trên dữ liệu nhạy cảm. Và nhớ rằng chạy được model chỉ là bước một; phần quyết định chất lượng vẫn nằm ở dữ liệu đã được chuẩn hóa và quản trị tới đâu.

🔥 TOP 3 TUẦN NÀY OpenAI ra GPT-5.6-Cyber: model tấn công mạng đầu tiên, hạ ngưỡng từ chối xuống rất thấp

Ngày 10/08 OpenAI công bố GPT-5.6-Cyber, xây trên nền GPT-5.6 Sol và huấn luyện riêng cho nghiên cứu lỗ hổng, pentest và ứng cứu sự cố. Model hoàn thành 95% các prompt về dựng chuỗi khai thác, leo thang đặc quyền và vượt xác thực, so với chỉ 1,5% của GPT-5.6 Sol.

💡 OpenAI dùng chính model này tìm ra hai lỗ hổng chưa từng biết trong V8 của Chrome, đã được Google vá dưới mã CVE-2026-15903. Model chỉ phát qua tier Daybreak Red cho đối tác tin cậy, nhưng việc một lab lớn công khai bán năng lực tấn công là bước ngoặt về chuẩn mực ngành.

📅 10/08 🔗 Website
  • Xây trên GPT-5.6 Sol, train riêng cho vulnerability research và pentest.
  • 95% hoàn thành prompt khai thác, so với 1,5% của bản Sol thường.
  • Tìm ra hai zero-day trong V8, Google vá dưới CVE-2026-15903.
  • Chỉ phát qua tier Daybreak Red cho đối tác được xác minh.
  • Mở rộng chương trình Daybreak sang khách hàng bên ngoài.
HOÀN THÀNH95% BẢN THƯỜNG1,5% ZERO-DAY2 lỗi trên V8 CVE2026-15903 KÊNH PHÁTDaybreak Red

Con số 95% so với 1,5% không phải là chuyện model giỏi hơn, mà là chuyện OpenAI chủ động gỡ bỏ lớp từ chối cho đúng nhóm tác vụ họ từng chặn gắt nhất. Đây là quyết định về chính sách chứ không phải về kỹ thuật, và nó dựa trên một lập luận thực dụng: nếu bên phòng thủ không có công cụ này thì bên tấn công vẫn sẽ có, chỉ là bằng model không kiểm soát. Việc tìm ra hai zero-day trong V8 là bằng chứng thuyết phục rằng năng lực là thật. Với doanh nghiệp Việt Nam, cái cần đổi ngay là giả định về tốc độ: chu kỳ từ lúc một CVE được công bố tới lúc có exploit chạy được đang rút ngắn mạnh, nên chính sách vá lỗi theo quý là không còn đủ. Điều nên làm là ưu tiên tự động hóa việc phát hiện và vá cho các thành phần internet-facing, và kiểm tra xem nhà cung cấp phần mềm của bạn cam kết SLA vá lỗi bao lâu. Không nên làm: hoảng hốt đi mua công cụ AI security mới; phần lớn rủi ro của các tổ chức vẫn nằm ở những thứ cũ như credential lộ và hệ thống chưa vá.

ByteDance đưa Seed 2.1 Turbo lên các nền tảng API: 262K context, giá bằng nửa bản Pro

Seed 2.1 Turbo của ByteDance có mặt trên các nền tảng API từ ngày 10/08, mang cửa sổ ngữ cảnh 262 nghìn token và cùng bộ năng lực với bản Pro gồm coding trọn vòng đời dự án, workflow agent nhiều bước và hiểu đa phương thức text, ảnh, video.

💡 Giá khoảng một nửa bản Pro cho cùng tập tính năng, nhắm thẳng vào nhóm chạy pipeline agent hoặc xử lý tài liệu khối lượng lớn nơi chi phí và độ trễ quan trọng hơn đỉnh năng lực. Đây là hướng phân tầng giá mà cả Google, OpenAI và ByteDance đang hội tụ.

📅 10/08 🔗 Website
  • Cửa sổ ngữ cảnh 262 nghìn token.
  • Cùng tập tính năng với Seed 2.1 Pro.
  • Hỗ trợ đa phương thức: text, ảnh và video.
  • Giá khoảng một nửa bản Pro trên mỗi token.
  • Nhắm vào workload doanh nghiệp chạy khối lượng lớn.
CONTEXT262K token GIÁ~½ bản Pro ĐA PHƯƠNG THỨCtext/ảnh/video NGÀY10/08/2026

Điểm đáng học ở đây không phải Seed 2.1 Turbo mạnh cỡ nào, mà là mô hình phân tầng đang trở thành chuẩn: mọi nhà cung cấp giờ đều có một bản đắt cho việc khó và một bản rẻ cho khối lượng lớn, cùng tính năng, khác giá và khác tốc độ. Nếu kiến trúc của bạn chỉ gọi một model duy nhất cho mọi việc thì bạn đang trả giá cao cho phần lớn các request đơn giản. Cách làm thực dụng là định tuyến theo độ khó: gọi model rẻ trước, có tiêu chí xác định khi nào cần leo thang lên model mạnh. Riêng với ByteDance, doanh nghiệp Việt Nam nên cân nhắc thêm yếu tố quản trị dữ liệu và nơi đặt endpoint trước khi đưa vào hệ thống có dữ liệu khách hàng, chứ đừng chỉ nhìn bảng giá.

🛠️ Công cụ & Framework

Gemini 3.7 Flash có mặt trong GitHub Copilot ngay ngày ra mắt

GitHub đưa Gemini 3.7 Flash vào Copilot ngay trong ngày 13/08, cùng ngày Google công bố model. Người dùng chọn được model này trong khung chat và các chế độ agent của Copilot.

💡 Khoảng cách giữa ngày một lab ra model và ngày nó xuất hiện trong IDE của bạn đã rút xuống bằng không. Với team dev, điều này nghĩa là việc chọn model không còn là quyết định kiến trúc dài hạn mà là một dropdown đổi được hàng tuần.

📅 13/08 🔗 Website
  • Có mặt trong Copilot đúng ngày Google công bố model.
  • Chọn được trong khung chat và các chế độ agent.
  • Nối dài danh sách model có thể đổi qua lại trong Copilot.
  • Không cần đổi cấu hình phía người dùng cuối.
NGÀY13/08/2026 ĐỘ TRỄ0 ngày PHẠM VIchat + agent

Tin nhỏ nhưng nói lên một thay đổi cấu trúc: IDE đang trở thành nơi các lab cạnh tranh trực tiếp, và người dùng cuối là bên được lợi vì đổi model chỉ tốn một cú click. Hệ quả cho team kỹ thuật là chuẩn đánh giá phải đổi. Đừng tranh luận model nào tốt nhất dựa trên bài viết trên mạng; hãy để mỗi người trong team dùng thử trên đúng codebase của công ty trong một tuần rồi so sánh cảm nhận cụ thể: nó có hiểu convention nội bộ không, nó có bịa API không, nó có làm hỏng test không. Đó là loại dữ liệu duy nhất đáng để ra quyết định.

Claude Cowork chạy thẳng trong side panel của Chrome

Từ ngày 12/08, side panel Claude trong Chrome trở thành một phiên Cowork đầy đủ: hội thoại lưu vào lịch sử, skill và connector hoạt động ngay trong trình duyệt, và việc bắt đầu ở một tab có thể tiếp tục trên desktop, web hoặc mobile.

💡 Đây là bước đưa agent ra khỏi cửa sổ chat riêng và đặt vào đúng nơi người ta làm việc thật. Hiện mới có trên gói Max và Team, đang mở dần cho Pro.

📅 12/08 🔗 Website
  • Side panel Chrome giờ là một phiên Cowork đầy đủ.
  • Hội thoại lưu vào lịch sử chung, không mất khi đóng tab.
  • Skill và connector hoạt động ngay trong trình duyệt.
  • Bắt đầu ở tab, tiếp tục trên desktop, web hoặc mobile.
  • Có trên gói Max và Team, đang mở dần cho Pro.
NGÀY12/08/2026 GÓIMax, Team ĐANG MỞPro ĐỒNG BỘdesktop/web/mobile

Cái mới ở đây không phải là có thêm một sidebar chat nữa, mà là phiên làm việc liên tục xuyên thiết bị. Trước đây mỗi cửa sổ agent là một ốc đảo, đóng lại là mất ngữ cảnh. Giờ bạn có thể mở một trang báo cáo, nhờ agent trích số, rồi mở laptop khác tiếp tục cùng phiên đó. Với công việc tư vấn và phân tích, đó là khác biệt thật sự vì phần lớn thời gian nằm ở việc gom ngữ cảnh chứ không phải ở việc hỏi. Một lưu ý về quản trị: nếu tổ chức của bạn dùng gói Enterprise, tính năng này mặc định tắt và admin phải bật cũng như giới hạn theo danh sách domain được duyệt. Đó là mặc định đúng, và mình khuyên nên giữ nguyên cách làm đó rồi mở dần theo nhóm.

OpenAI phát hành app ChatGPT cho Linux, kèm Codex ở bản preview

Ngày 11/08 OpenAI mở bản preview app desktop ChatGPT cho Linux, hỗ trợ Ubuntu 24.04 và 26.04 LTS, Debian 13, Fedora 43 và 44, đóng gói DEB và RPM cho cả x64 lẫn ARM64. App chạy được ChatGPT, ChatGPT Work và Codex.

💡 Linux là nền tảng bị yêu cầu nhiều nhất và cũng là nơi phần lớn dev backend và data engineer thật sự làm việc. Phản hồi ban đầu khá lẫn lộn về hiệu năng và tích hợp, nhưng ít nhất Codex đã có cửa vào máy trạm Linux mà không cần trình duyệt.

📅 11/08 🔗 Website
  • Bản preview phát hành toàn cầu ngày 11/08.
  • Hỗ trợ Ubuntu 24.04 và 26.04 LTS, Debian 13, Fedora 43 và 44.
  • Gói DEB và RPM cho cả kiến trúc x64 và ARM64.
  • Chạy được ChatGPT, ChatGPT Work và Codex.
  • Phản hồi ban đầu phàn nàn về hiệu năng và tích hợp.
NGÀY11/08/2026 DISTRO5 bản GÓIDEB + RPM KIẾN TRÚCx64 + ARM64 TRẠNG THÁIpreview

Việc này tưởng nhỏ nhưng quan trọng với đúng nhóm người dùng khó tính nhất. Data engineer, DevOps và phần lớn backend team chạy Linux, và trước đây họ phải dùng ChatGPT qua trình duyệt hoặc chỉ dùng Codex CLI. Có app native nghĩa là Codex tiếp cận được filesystem và workflow cục bộ theo cách nhất quán với macOS và Windows. Đây mới là preview và phản hồi cộng đồng khá hỗn hợp, nên đừng vội đưa vào quy trình chuẩn của team. Cách dùng hợp lý bây giờ là để một hai người thử trước, ghi lại chỗ vướng, rồi quyết định sau vài bản cập nhật. Với môi trường có dữ liệu nhạy cảm, hãy kiểm tra kỹ app truy cập những thư mục nào trước khi cấp quyền rộng.

Docker Sandboxes: microVM dùng một lần cho coding agent chạy không cần giám sát

Docker ra bản thử nghiệm Docker Sandboxes, chạy các coding agent như Claude Code, Copilot CLI, Codex, OpenCode và Kiro trong microVM cô lập với kernel riêng, Docker daemon riêng, filesystem và network riêng. Mỗi sandbox đã cài sẵn Docker CLI, Git, GitHub CLI, Node.js, Python 3, Go, uv và jq.

💡 Bài toán năm nay không còn là agent có viết được code không, mà là cho nó chạy tự do ở đâu mà không mất credential hay hỏng máy. Bản tin đứng trong nhóm dẫn đầu Hacker News với gần 700 điểm và 396 bình luận, cho thấy đây đúng là điểm đau chung.

📅 10/08 🔗 Website
  • Mỗi phiên là một microVM với kernel riêng trên hypervisor gốc của hệ điều hành.
  • Chạy trên Hypervisor.framework, WHP hoặc KVM tùy nền tảng.
  • Agent build container, cài package, sửa file mà không đụng máy host.
  • Cài sẵn Docker CLI, Git, GitHub CLI, Node.js, Python 3, Go, uv, jq.
  • Hỗ trợ Claude Code, Copilot CLI, Codex, OpenCode và Kiro.
CÔ LẬPmicroVM HN692 điểm BÌNH LUẬN396 NGÀY10/08/2026 TRẠNG THÁIthử nghiệm

Điểm khác biệt so với container thường là mỗi sandbox có kernel riêng, tức là mức cô lập cao hơn hẳn namespace của Docker truyền thống. Điều này quan trọng vì agent hiện đại có quyền chạy lệnh tùy ý, và một prompt injection từ trang web hay từ file trong repo đủ để nó làm chuyện bạn không muốn. Cách làm đúng bây giờ là: agent không bao giờ chạy trực tiếp trên máy có credential thật. Cho nó vào sandbox, cấp secret theo phạm vi hẹp nhất, và review diff trước khi merge. Mình thấy nhiều team bỏ qua bước này vì thấy phiền, rồi chỉ sửa sau khi có sự cố. Với chi phí thiết lập chỉ vài phút, đây là thứ nên làm ngay chứ không nên đợi. Lưu ý bản này còn là thử nghiệm, nên đừng đặt cược cả CI pipeline vào nó vội.

🔬 Nghiên cứu & Kỹ thuật mới

AI4AI at Test-Time: model mạnh tự dựng harness để nâng model yếu, không cần train lại

Nhóm của Cheng Qian nghiên cứu việc để một model mạnh tự xây harness ở thời điểm inference cho một model yếu hơn, không đụng đến tham số. Mỗi builder dùng 5% dữ liệu làm validation để tinh chỉnh harness qua nhiều vòng, rồi đánh giá trên toàn bộ test set của bốn benchmark Theory-of-Mind.

💡 Kết quả cho thấy GPT-5.4-mini cải thiện tới 87% tương đối, đạt 0,912 macro-average, tiệm cận harness do người thiết kế. Nghĩa là phần lớn khoảng cách giữa model rẻ và model đắt có thể lấp bằng scaffolding chứ không phải bằng tiền train.

📅 12/08 🔗 Website
  • Builder model mạnh tự sinh harness cho target model yếu hơn.
  • Không cập nhật tham số của model đích, chỉ can thiệp ở inference.
  • Dùng 5% dữ liệu làm validation, tinh chỉnh harness qua nhiều vòng.
  • Thử trên bốn benchmark Theory-of-Mind tiêu biểu.
  • GPT-5.4-mini tăng tới 87% tương đối, đạt 0,912 macro-average.
ARXIV2608.12307 CẢI THIỆN+87% tương đối ĐIỂM0,912 VALIDATION5% dữ liệu NGÀY12/08/2026

Đây là bài mình thấy có giá trị ứng dụng cao nhất tuần. Ý tưởng rất thực dụng: thay vì trả tiền gọi model đắt cho mọi request, bạn dùng model đắt một lần để nó tự thiết kế cái khung prompt, cách chia bước và cách kiểm tra kết quả, rồi chạy sản xuất bằng model rẻ trong cái khung đó. Với một use case ổn định, chi phí thiết kế là một lần còn tiết kiệm thì lặp lại mãi. Bài chỉ thử trên nhóm benchmark Theory-of-Mind nên đừng vội tổng quát hóa sang mọi tác vụ, nhưng cơ chế thì áp dụng được ngay. Điều cần lưu ý là bạn phải có tập validation thật của mình, dù nhỏ, vì harness được tối ưu cho phân phối dữ liệu nào thì chỉ tốt trên phân phối đó. Đây cũng là lý do mình hay nói: vấn đề thường không nằm ở model, mà ở cách mình thiết kế workflow và dữ liệu quanh nó.

ComBodied Agents: đề xuất chuyển agent từ làm xong việc sang chăm trạng thái con người

Bài viết của 22 tác giả đề xuất khung ComBodied Agents, gộp agent số và agent có thân thể vào một hệ thống theo dõi và hỗ trợ quỹ đạo trạng thái của từng người theo thời gian. Bốn thành phần lõi gồm cảm nhận đa phương thức các sự kiện cá nhân, bộ nhớ dài hạn sửa được, Personal World Model dự đoán kết quả theo từng can thiệp, và chính sách can thiệp tôn trọng quyền đồng ý của người dùng.

💡 Đây là bài đứng đầu Hugging Face Papers tuần này với 184 lượt vote, cho thấy hướng nghiên cứu đang dịch từ tối ưu benchmark tác vụ sang tối ưu kết quả cho người. Với ai làm sản phẩm, thứ đáng lấy là ý tưởng bộ nhớ dài hạn sửa được và ràng buộc can thiệp phải có đồng thuận.

📅 12/08 🔗 Website
  • 22 tác giả, đứng đầu Hugging Face Papers với 184 vote.
  • Gộp agent số và agent có thân thể vào một khung chung.
  • Cảm nhận đa phương thức các sự kiện cá nhân theo thời gian.
  • Bộ nhớ dài hạn có thể sửa lại khi thông tin sai.
  • Personal World Model dự đoán kết quả theo từng can thiệp.
ARXIV2608.10915 VOTE HF184 TÁC GIẢ22 THÀNH PHẦN4 lõi NGÀY12/08/2026

Bài này thiên về đề xuất khung tư duy hơn là kết quả đo được, nên đừng đọc nó như một paper có state of the art. Nhưng có hai ý đáng mang về ngay cho người làm sản phẩm. Thứ nhất, bộ nhớ dài hạn phải sửa được. Rất nhiều hệ thống RAG và agent hiện nay chỉ biết thêm vào chứ không biết đính chính, và sau vài tháng thì kho ngữ cảnh đầy thông tin lỗi thời mà không ai dọn. Thứ hai, chính sách can thiệp phải có ranh giới đồng thuận rõ ràng. Một agent chủ động nhắc việc thì hữu ích, nhưng một agent chủ động hành động thay bạn mà không hỏi thì rất nhanh trở thành phiền toái hoặc rủi ro. Nếu bạn đang thiết kế trợ lý cho nhân viên trong doanh nghiệp, hai nguyên tắc này đáng đưa vào từ bản thiết kế đầu tiên chứ không phải vá sau.

Pathway BDH-CQ: model 150M phá kỷ lục chi phí trên ARC-AGI-1, rẻ hơn GPT-5.6 Luna 11 lần

Pathway công bố BDH-CQ, kiến trúc hậu transformer suy luận bằng trạng thái ẩn hồi quy thay vì sinh chuỗi chain-of-thought. Bản 150 triệu tham số đạt 29,5% pass@2 trên ARC-AGI-1 với chi phí 0,0007 USD mỗi tác vụ, tức chưa tới một phần mười xu.

💡 Rẻ hơn khoảng 11 lần so với GPT-5.6 Luna bản Low ngay cả sau khi OpenAI giảm giá 80%, dù điểm thấp hơn chút, 29,5 so với 34,2. Điểm này nằm ngoài đường Pareto từng được ghi nhận, nhắc rằng không phải bài toán nào cũng cần model nghìn tỷ tham số.

📅 11/08 🔗 Website
  • 150 triệu tham số, kiến trúc hậu transformer.
  • Suy luận trong trạng thái ẩn hồi quy, không sinh chuỗi văn bản trung gian.
  • Đạt 29,5% pass@2 trên ARC-AGI-1.
  • Chi phí 0,0007 USD mỗi tác vụ, chưa tới một phần mười xu.
  • Rẻ hơn GPT-5.6 Luna bản Low khoảng 11 lần; Luna đạt 34,2%.
ARXIV2608.09888 THAM SỐ150 triệu ĐIỂM29,5% pass@2 CHI PHÍ0,0007 $/task RẺ HƠN×11

Điểm thú vị về kỹ thuật là model này không viết ra bước suy nghĩ, nó suy luận bằng cách cập nhật một trạng thái ẩn nhiều chiều qua nhiều vòng. Nghĩa là toàn bộ chi phí token của chain-of-thought biến mất. Với 150 triệu tham số, nó đạt gần bằng model frontier trên ARC-AGI-1 với chi phí thấp hơn cả chục lần. Đừng đọc tin này thành model nhỏ sắp thay model lớn, vì ARC-AGI là một loại bài toán suy luận trừu tượng rất đặc thù. Nhưng nó nhắc một điều mình luôn nói với khách hàng: đừng mặc định lấy model to nhất cho mọi việc. Hãy phân loại workload của bạn, và với những tác vụ lặp lại hàng triệu lần, chênh lệch mười một lần chi phí là khác biệt giữa có lãi và lỗ. Hướng kiến trúc hậu transformer đáng theo dõi trong sáu tháng tới, nhất là cho các bài toán chạy trên biên hoặc trên thiết bị.

Co-Evolution in Agentic Systems: khảo sát hướng agent tự tiến hóa vượt khỏi thiết kế của người

Nhóm tác giả từ HKUST và cộng sự khảo sát cách nhiều agent và môi trường của chúng cùng thích nghi và cải thiện lẫn nhau. Bài đề xuất khung ba tầng gồm agent với agent, agent với môi trường, và meta co-evolution, mỗi tầng giảm dần ràng buộc do con người thiết kế.

💡 Bài chỉ thẳng ba điểm nghẽn còn bỏ ngỏ: đánh giá thế nào, mở rộng quy mô ra sao và kiểm soát an toàn kiểu gì khi hệ thống tự sửa chính mình. Với doanh nghiệp, đây là bản đồ rủi ro nên đọc trước khi thả agent tự chỉnh workflow trong môi trường sản xuất.

📅 10/08 🔗 Website
  • Khảo sát toàn diện về co-evolution trong hệ thống nhiều agent.
  • Ba tầng: agent–agent, agent–môi trường và meta co-evolution.
  • Mỗi tầng giảm dần ràng buộc do con người thiết kế sẵn.
  • Nêu rõ ba thách thức: đánh giá, mở rộng quy mô và an toàn.
  • Đạt 125 vote trên Hugging Face Papers.
ARXIV2608.10299 VOTE HF125 TẦNG3 NGÀY10/08/2026

Đây là bài khảo sát, tức là giá trị nằm ở bản đồ chứ không ở kết quả mới. Nhưng bản đồ này đáng đọc với ai đang cân nhắc để agent tự điều chỉnh quy trình. Điểm mấu chốt là khi hệ thống tự sửa chính nó, bạn mất khả năng dự đoán hành vi bằng cách đọc code, và mọi phương pháp đánh giá tĩnh đều lỗi thời ngay sau vòng tiến hóa đầu tiên. Với doanh nghiệp Việt Nam, khuyến nghị của mình rất thẳng: đừng thả agent tự sửa workflow trong môi trường production. Hãy để nó đề xuất thay đổi, còn việc áp dụng thì qua một cổng duyệt của con người, đúng như cách bạn quản lý pull request. Tự động hóa việc đề xuất thì được, tự động hóa việc phê duyệt thì chưa. Đây không phải sợ công nghệ, mà là vì hiện chưa có cách đánh giá tin cậy cho hệ thống tự tiến hóa, và chính bài này thừa nhận điều đó.

📈 Hot trend & Thảo luận cộng đồng

Khảo sát: người trẻ Mỹ không tin các tỷ phú đang dẫn dắt AI

Một khảo sát mới cho thấy người trẻ Mỹ có mức tin tưởng rất thấp vào giới lãnh đạo tỷ phú của ngành AI. Bài đăng trên r/technology ngày 13/08 thu gần 27 nghìn upvote và hơn 1.400 bình luận, thuộc nhóm thảo luận sôi nổi nhất tuần.

💡 Khoảng cách giữa cái ngành AI tự nói về mình và cái công chúng cảm nhận đang giãn rất nhanh. Với ai làm sản phẩm AI cho người dùng cuối, đây là tín hiệu rằng thông điệp tầm nhìn không còn bán được, thứ bán được là kết quả cụ thể.

📅 13/08 🔗 Website
  • Gần 27 nghìn upvote trên r/technology chỉ trong một ngày.
  • Hơn 1.400 bình luận, thuộc nhóm sôi nổi nhất tuần.
  • Nhóm được khảo sát là người trẻ tại Mỹ.
  • Nằm cùng cụm với các thảo luận phản đối AI khác trong tháng.
UPVOTE~27.000 BÌNH LUẬN1.432 NGUỒNr/technology NGÀY13/08/2026

Con số upvote nói lên cảm xúc, không nói lên tỷ lệ dân số, nên đừng đọc nó như một điều tra xã hội học. Nhưng tín hiệu vẫn rõ: sự hoài nghi với ngành AI đang trở thành mặc định trong nhóm người dùng trẻ, không còn là ý kiến thiểu số. Với người làm sản phẩm, hệ quả rất thực tế. Cách marketing kiểu tầm nhìn vĩ đại và cách mạng hóa mọi thứ giờ phản tác dụng, nó kích hoạt phản xạ phòng thủ. Thứ hiệu quả hơn là nói cụ thể sản phẩm tiết kiệm được bao nhiêu phút cho việc gì, dữ liệu đi đâu, và người dùng tắt nó bằng cách nào. Mình thấy điều này đúng cả ở Việt Nam khi triển khai công cụ AI nội bộ: nhóm dùng nhiều nhất luôn là nhóm được giải thích rõ ràng chuyện gì đang diễn ra, chứ không phải nhóm được nghe pitch hay nhất.

AI đang xóa sổ tầng lớp giữa của nghề kỹ sư phần mềm: 978 điểm trên Hacker News

Kỹ sư Florian Herrengt lập luận rằng công cụ coding agent nhanh đã gỡ bỏ cái phanh tốc độ tự nhiên vốn kìm hãm các quyết định kỹ thuật tồi, khiến team yếu tích tụ độ phức tạp không review nổi nhanh hơn trước rất nhiều. Bài đạt 978 điểm và hơn 900 bình luận trên Hacker News ngày 12/08.

💡 Luận điểm cốt lõi: senior vẫn thiết kế hệ thống, junior vẫn học nền tảng, người bị ép mạnh nhất là tầng giữa, tức nhóm dịch yêu cầu thành code bảo trì được và đặt câu hỏi khó lúc review. Kỹ năng khan hiếm chuyển từ tốc độ viết sang khả năng phán đoán và kiểm chứng output.

📅 12/08 🔗 Website
  • 978 điểm và hơn 900 bình luận trên Hacker News.
  • Agent nhanh gỡ bỏ phanh tốc độ vốn kìm hãm quyết định kỹ thuật tồi.
  • Team yếu tích tụ độ phức tạp không review nổi nhanh hơn trước.
  • Tầng giữa chịu áp lực lớn nhất, không phải junior hay senior.
  • Tác giả dự đoán khoảng cách lương giữa các nhóm sẽ giãn ra.
ĐIỂM HN978 BÌNH LUẬN904 NGÀY12/08/2026 TÁC GIẢFlorian Herrengt

Mình đồng ý một nửa với bài này. Phần đúng: khi tốc độ viết code không còn là ràng buộc, thứ khan hiếm trở thành khả năng phán đoán, tức là nhìn vào output của AI và biết ngay chỗ nào sai, chỗ nào sẽ vỡ khi scale. Phần mình dè dặt: bài mô tả tầng giữa như một nhóm cố định, trong khi thực tế đó là một giai đoạn nghề nghiệp mà ai cũng đi qua. Nếu tầng giữa biến mất thì câu hỏi thật là junior học lên bằng con đường nào. Với các team ở Việt Nam, khuyến nghị của mình rất cụ thể: đừng cắt junior để tiết kiệm chi phí rồi kỳ vọng AI bù vào, vì hai năm nữa bạn sẽ không có senior. Thay vào đó hãy đổi cách đào tạo, chuyển trọng tâm từ dạy viết code sang dạy đọc code, dạy review, dạy đặt câu hỏi về ràng buộc và rủi ro. AI không thay người giỏi, nó khuếch đại người biết làm việc rõ ràng, và cũng khuếch đại luôn cái bừa bộn của người làm việc không rõ ràng.

AI ăn dần web, và trí nhớ tập thể của internet đang biến mất

Bài trên The Walrus phân tích việc Google gói câu trả lời thành AI Overview khiến người dùng không còn nhấp vào trang gốc, tước đi giọng điệu, ký ức và cộng đồng đằng sau nội dung. Bài đạt 933 điểm và 976 bình luận trên Hacker News ngày 10/08.

💡 Sau khi các nhà xuất bản kiện Internet Archive, nhiều tòa soạn bắt đầu chặn cả crawler của Wayback Machine, làm mất luôn lớp lưu trữ dự phòng. Vòng lặp nguy hiểm là chính các model AI rồi cũng sẽ có ít dữ liệu chính xác, kịp thời và thú vị hơn để học.

📅 10/08 🔗 Website
  • 933 điểm và 976 bình luận trên Hacker News.
  • AI Overview trả lời trọn gói, người dùng không ghé trang gốc.
  • Nhiều tòa soạn chặn cả crawler của Wayback Machine sau vụ kiện Internet Archive.
  • Nội dung dạng phù du như Stories không bao giờ được lưu trữ.
  • Hệ quả vòng lặp: model AI cũng mất nguồn dữ liệu chất lượng.
ĐIỂM HN933 BÌNH LUẬN976 NGUỒNThe Walrus NGÀY10/08/2026

Đây là bài đáng đọc kỹ vì nó chỉ ra một vòng lặp mà ai làm nội dung hoặc làm dữ liệu đều nên hiểu. Google lấy nội dung để tổng hợp câu trả lời, người dùng không ghé trang gốc, người viết mất động lực, kho tri thức mới ít đi, và cuối cùng chính các model cũng nghèo dữ liệu hơn. Phần về lưu trữ còn đáng lo hơn: khi các tòa soạn chặn cả Wayback Machine thì lớp bảo hiểm cuối cùng cho trí nhớ của internet cũng mất. Với người làm nội dung ở Việt Nam, bài học thực dụng là đừng đặt toàn bộ phân phối vào tay tìm kiếm. Hãy xây kênh trực tiếp: newsletter, cộng đồng, kênh riêng. Với người làm dữ liệu, đây là lời nhắc rằng nguồn dữ liệu công khai đang co lại, nên dữ liệu nội bộ đã được chuẩn hóa của chính doanh nghiệp bạn ngày càng có giá trị hơn so với việc đi lấy ngoài.

Zuckerberg viết luận 6.500 chữ công kích các lab AI đóng, đòi Mỹ gỡ rào cho open-source

Cùng ngày Meta ra Muse Glimmer, Mark Zuckerberg đăng bài luận 6.500 chữ tựa The Future is for Everyone, cho rằng model mở của Mỹ phải trở thành tốt nhất thế giới và chỉ trích các đối thủ lấy lý do an toàn để khóa model mạnh nhất. Ông nói đối thủ nước ngoài ít ràng buộc hơn nên chính sách Mỹ phải giảm ma sát về dữ liệu huấn luyện.

💡 Bài lọt top Hacker News với 640 điểm và hơn 600 bình luận, đúng vào lúc Washington đang cân nhắc siết model open-weight Trung Quốc. Đây là cuộc chiến chuẩn mực chứ không chỉ chuyện kỹ thuật, và kết quả sẽ quyết định team nhỏ ở Việt Nam năm sau còn được tải model gì về chạy.

📅 10/08 🔗 Website
  • Bài luận 6.500 chữ tựa The Future is for Everyone.
  • 640 điểm và hơn 600 bình luận trên Hacker News.
  • Chỉ trích các lab lấy an toàn làm lý do khóa model mạnh nhất.
  • Đòi chính sách Mỹ giảm ràng buộc về dữ liệu huấn luyện.
  • Không nêu đích danh nhưng được hiểu là nhắm OpenAI và Anthropic.
ĐỘ DÀI6.500 chữ ĐIỂM HN640 BÌNH LUẬN601 NGÀY10/08/2026

Cần tách hai lớp khi đọc tin này. Lớp thứ nhất là lợi ích: Meta không dẫn đầu ở model đóng nên mở là chiến lược cạnh tranh hợp lý, hệt như cách họ từng dùng với Llama. Lớp thứ hai là lập luận, và lập luận này có phần đúng thật: nếu model mở tốt nhất thế giới đến từ Trung Quốc thì tiêu chuẩn kỹ thuật và hệ sinh thái công cụ sẽ hình thành quanh đó. Điều đáng chú ý cho Việt Nam là hệ quả thực tế của cuộc tranh luận này. Chúng ta là bên hưởng lợi thuần từ model mở, dù nó đến từ Mỹ hay Trung Quốc, vì nó cho phép chạy cục bộ, kiểm soát dữ liệu và không bị khóa vào một nhà cung cấp. Nên điều nên làm là xây năng lực triển khai model mở ngay bây giờ, chứ đừng chờ xem bên nào thắng. Kỹ năng vận hành một model open-weight trên hạ tầng riêng có giá trị bất kể nhãn hiệu trên model đó là gì.

🏢 Ngành & Kinh doanh

🔥 TOP 5 TUẦN NÀY Anthropic ký hợp đồng 9,1 tỷ USD trong 20 năm với Riot Platforms để lấy 191 MW

Anthropic ký thỏa thuận 20 năm trị giá 9,1 tỷ USD với công ty đào bitcoin Riot Platforms để lấy 191 megawatt công suất tính toán từ campus Rockdale ở Texas, kéo dài đến tháng 6 năm 2048. Hợp đồng kèm hai quyền gia hạn 5 năm, nếu dùng cả hai thì tổng doanh thu có thể lên 16,1 tỷ USD.

💡 Cổ phiếu Riot tăng 25% sau tin, và đây là ví dụ rõ nhất cho làn sóng thợ đào bitcoin chuyển thành nhà cung cấp hạ tầng AI. Điều đáng chú ý là Anthropic đang khóa nguồn điện và mặt bằng đến tận năm 2048, tức compute giờ được mua như bất động sản chứ không như dịch vụ cloud.

📅 11/08 🔗 Website
  • Hợp đồng 20 năm, doanh thu dự kiến 9,1 tỷ USD.
  • 191 megawatt từ campus Rockdale, bang Texas.
  • Chạy đến tháng 6 năm 2048, kèm hai quyền gia hạn 5 năm.
  • Nếu gia hạn hết, tổng doanh thu có thể đạt 16,1 tỷ USD.
  • Riot công bố ngày 10/08, cổ phiếu tăng 25% lên 24,40 USD.
GIÁ TRỊ9,1 tỷ $ CÔNG SUẤT191 MW THỜI HẠNđến 2048 TỐI ĐA16,1 tỷ $ CỔ PHIẾU RIOT+25%

Hai điều đáng suy nghĩ ở đây. Thứ nhất, thợ đào bitcoin đang trở thành nhà cung cấp hạ tầng AI vì họ sở hữu đúng thứ khó kiếm nhất: hợp đồng điện dài hạn, mặt bằng đã có trạm biến áp và giấy phép. GPU thì mua được bằng tiền, còn 191 megawatt đấu nối sẵn thì phải mất nhiều năm mới có. Thứ hai, độ dài hợp đồng nói lên tất cả. Khóa đến năm 2048 nghĩa là Anthropic tin nhu cầu compute sẽ tăng liên tục hai thập kỷ, và họ chấp nhận trả giá cố định để tránh rủi ro giá điện. Với doanh nghiệp Việt Nam, bài học rút ra không phải là đi ký hợp đồng điện, mà là hiểu rằng giá inference bạn đang trả sẽ chịu ảnh hưởng của chi phí điện và hạ tầng dài hạn chứ không chỉ của cạnh tranh giữa các lab. Đừng xây mô hình kinh doanh dựa trên giả định giá token sẽ giảm mãi mãi.

🔥 TOP 1 TUẦN NÀY Nvidia bắt tay Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs và KKR huy động hơn 500 tỷ USD

Ngày 10/08 Nvidia công bố lập các nền tảng tài trợ hạ tầng compute độc lập cùng sáu nhà quản lý tài sản lớn nhất Phố Wall, nhằm huy động hơn 500 tỷ USD vốn bên thứ ba cho data center, điện và hạ tầng AI. Các thỏa thuận ở dạng biên bản ghi nhớ, thiết kế để nhà đầu tư ngoài rót tiền mà không phình bảng cân đối của Nvidia.

💡 Jensen Huang gọi chip của mình là tài sản đầu tư được, tức Nvidia đang cố biến GPU thành một lớp tài sản có thể thế chấp giống bất động sản thương mại hay đường thu phí. Nếu thành công, nút thắt của ngành AI chuyển từ vốn sang điện và đất, còn nếu vỡ thì rủi ro giờ nằm rải khắp hệ thống tài chính chứ không riêng bảng cân đối một công ty.

📅 10/08 🔗 Website
  • Sáu đối tác: Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs, KKR.
  • Mục tiêu huy động hơn 500 tỷ USD vốn bên thứ ba.
  • Dòng tiền dành cho data center, hệ thống điện và hạ tầng AI.
  • Cấu trúc dạng biên bản ghi nhớ, không nằm trên bảng cân đối Nvidia.
  • Phục vụ hyperscaler, các lab frontier và doanh nghiệp lớn.
QUY MÔ500 tỷ $ ĐỐI TÁC6 quỹ lớn CẤU TRÚCMOU NGÀY10/08/2026

Đây là tin quan trọng nhất tuần và cũng dễ bị đọc lướt nhất, vì nó là tin tài chính chứ không phải tin công nghệ. Bản chất là Nvidia đang cố biến GPU thành một lớp tài sản mà quỹ hưu trí và quỹ đầu tư tổ chức có thể rót tiền vào, giống hệt cách người ta tài trợ cho tòa nhà văn phòng hay đường thu phí. Cấu trúc rất khéo: vốn từ bên ngoài nên bảng cân đối của Nvidia vẫn sạch, nhưng nhu cầu GPU thì được bơm bằng tiền của người khác. Tốt cho ai? Tốt cho các lab lớn vì có compute rẻ hơn và dài hạn hơn. Rủi ro cho ai? Nếu chu kỳ đảo chiều, người chịu là nhà đầu tư tổ chức, tức là những người chưa từng chạy một job training nào. Với doanh nghiệp Việt Nam, điều thực dụng cần rút ra: nguồn cung compute trong hai đến ba năm tới sẽ dồi dào và giá có thể còn dễ chịu. Nhưng đừng thiết kế mô hình kinh doanh dựa trên giả định giá sẽ rẻ mãi, vì cấu trúc này chỉ bền chừng nào nhu cầu còn tăng.

IPO Unitree bị đăng ký vượt hơn 8.000 lần, định giá gấp 219 lần lợi nhuận

Đợt IPO khoảng 900 triệu USD của Unitree Robotics trên sàn Thượng Hải bị nhà đầu tư cá nhân đăng ký vượt 8.288 lần, với 53,64 tỷ lệnh đặt mua. Giá chào bán 150,8 nhân dân tệ mỗi cổ phiếu đưa định giá công ty lên khoảng 61 tỷ nhân dân tệ, tương đương 9,04 tỷ USD.

💡 Unitree là công ty robot hình người thuần túy đầu tiên niêm yết trên sàn Trung Quốc đại lục, và tỷ lệ trúng của nhà đầu tư lẻ chỉ khoảng 0,018%. Mức 219 lần lợi nhuận cho thấy embodied AI đang được định giá theo kỳ vọng chứ không theo dòng tiền.

📅 10/08 🔗 Website
  • Đăng ký vượt 8.288 lần với 53,64 tỷ lệnh đặt mua từ nhà đầu tư lẻ.
  • Giá chào bán 150,8 nhân dân tệ, định giá khoảng 9,04 tỷ USD.
  • Bán 40,45 triệu cổ phiếu mới, tương đương 10% vốn sau phát hành.
  • Tỷ lệ trúng của nhà đầu tư lẻ chỉ khoảng 0,018%.
  • Công ty robot hình người thuần túy đầu tiên niêm yết ở đại lục.
VƯỢT ĐĂNG KÝ8.288 lần ĐỊNH GIÁ9,04 tỷ $ HUY ĐỘNG~904 triệu $ P/E219 lần TỶ LỆ TRÚNG0,018%

Mức 219 lần lợi nhuận và 8.288 lần đăng ký vượt là những con số của một thị trường đang mua kỳ vọng chứ không mua dòng tiền. Điều đó không tự động nghĩa là bong bóng, nhưng nó cho biết định giá hiện tại đã gói sẵn giả định rằng robot hình người sẽ thành sản phẩm đại chúng trong vài năm tới. Điều đáng chú ý hơn với người làm công nghệ là tín hiệu chính sách: Trung Quốc đang mở đường vốn công khai cho embodied AI, và Unitree sẽ có tiền để đẩy nhanh chu kỳ phần cứng. Với Việt Nam, hệ quả gần nhất là giá robot và cánh tay robot nhập từ Trung Quốc nhiều khả năng tiếp tục giảm, mở cửa cho các ứng dụng tự động hóa quy mô nhỏ trong sản xuất và kho vận mà trước đây không đủ hiệu quả kinh tế. Đó mới là cơ hội thực tế, chứ không phải chuyện mua cổ phiếu.

Firmus Grid gọi 2 tỷ USD Series G từ Nvidia, Coatue và Blackstone ở định giá 10,5 tỷ

Firmus Grid, công ty xây các nhà máy AI làm mát bằng ngâm chất lỏng cho cụm GPU, gọi 2 tỷ USD vòng Series G từ Nvidia, Coatue và Blackstone ở định giá 10,5 tỷ USD. Đây là vòng gọi vốn đơn lẻ lớn nhất được công bố trong tháng 8 năm 2026.

💡 Tuần này vốn mạo hiểm gần như chỉ chảy về hạ tầng chứ không về ứng dụng: Hadrian gọi 1,37 tỷ USD, Lumilens hơn 700 triệu USD, đều là lớp vật lý bên dưới AI. Với startup ứng dụng, điều này nghĩa là định giá dựa trên mô hình AI thuần đang khó bán hơn hẳn so với thứ có tài sản cứng.

📅 10/08 🔗 Website
  • 2 tỷ USD Series G, định giá 10,5 tỷ USD.
  • Nhà đầu tư gồm Nvidia, Coatue và Blackstone.
  • Xây nhà máy AI làm mát bằng ngâm chất lỏng cho cụm GPU.
  • Vòng đơn lẻ lớn nhất công bố trong tháng 8 năm 2026.
  • Cùng tuần: Hadrian 1,37 tỷ USD, Lumilens hơn 700 triệu USD.
VÒNGSeries G SỐ TIỀN2 tỷ $ ĐỊNH GIÁ10,5 tỷ $ DẪN DẮTNvidia, Coatue, Blackstone NGÀY10/08/2026

Đọc danh sách các vòng lớn nhất tuần này thì thấy một điểm chung rất rõ: gần như toàn bộ tiền chảy vào lớp vật lý dưới AI, tức là điện, làm mát, kết nối, nhà máy. Không có startup ứng dụng AI thuần nào lọt vào nhóm dẫn đầu. Với founder Việt Nam đang gọi vốn, đây là tín hiệu nên đọc kỹ: câu chuyện chúng tôi dùng AI để làm X đang mất giá nhanh vì ai cũng dùng được AI. Thứ nhà đầu tư trả tiền là những gì khó sao chép, gồm dữ liệu độc quyền, quan hệ phân phối, tài sản vật lý hoặc quy trình vận hành đã chạy được. Việc Nvidia trực tiếp đầu tư vào Firmus cũng đáng chú ý, vì nó cho thấy chiến lược của họ không dừng ở bán chip mà là tài trợ cả nhu cầu mua chip, khớp với thương vụ 500 tỷ USD cùng tuần.

Bản tin tạo lúc 14/08/2026 · tổng cộng 22 tin trong tuần W33 (10/08 - 16/08/2026)

Tuyển chọn & đọc bởi Duc Nguyen · ducnguyen.vn