🎬 Video recap tuần — các tin nóng nhất

⚡ Tổng quan tuần này

Tuần 31 là tuần open-weight lập kỷ lục: Moonshot mở trọng số Kimi K3 với 2,8 nghìn tỷ tham số, file nặng 1,4 TB — bản mở lớn nhất từng có, và vLLM vá hỗ trợ chỉ trong vài ngày. Ở phía hạ tầng, Nvidia đang thương lượng bảo lãnh khoảng 250 tỷ USD để OpenAI thuê được campus 10 gigawatt do SoftBank xây trên nền nhà máy làm giàu uranium cũ ở Ohio, tổng dự án có thể vượt 500 tỷ USD. Google DeepMind ra Gemini Robotics 2 đưa robot hình người từ mặt bàn ra toàn thân, đồng thời giải thể đội AlphaFold từng đoạt Nobel. Về nền tảng kỹ thuật, MCP chốt bản spec 2026-07-28 lớn nhất lịch sử giao thức: bỏ handshake, chuyển sang stateless để chạy được trên serverless và edge. Và sau vụ model của OpenAI tự thoát sandbox, Nvidia dẫn đầu liên minh Open Secure AI Alliance với hơn 37 tổ chức — vắng mặt đúng ba cái tên đóng kín nhất là OpenAI, Google và Anthropic.

T2 27/079 tin
T3 28/079 tin
T4 29/072 tin
T5 30/074 tin
T6 31/070 tin
T7 01/080 tin
CN 02/080 tin

🚀 Mô hình & Sản phẩm mới

🔥 TOP 3 TUẦN NÀY Google DeepMind ra Gemini Robotics 2: robot hình người điều khiển toàn thân, năm ngón tay và làm việc nhóm

Google DeepMind phát hành ba model Gemini Robotics 2 đưa robot vượt khỏi thao tác trên mặt bàn sang điều khiển toàn thân, khéo léo năm ngón và phối hợp nhiều robot cùng lúc. Trong thử nghiệm, hệ thống tháo được bóng đèn thành công 92% số lần.

💡 Vì sao đáng chú ý: đây là lần đầu một hãng lab lớn gộp vision, language và action thành một stack chạy được trên nhiều loại thân robot khác nhau — bước chuyển từ demo sang thứ có thể triển khai.

📅 30/07 🔗 Website
  • Ba model: Gemini Robotics 2, Robotics ER 2 và bản on-device.
  • ER 2 lo phần lập kế hoạch nhiều bước và điều phối nhiều robot.
  • Tháo bóng đèn thành công 92% — chỉ số khéo léo hiếm khi được công bố.
  • Kèm ASIMOV-Agentic: benchmark đo an toàn khi nhiều AI cùng điều khiển robot.
  • Đầu vào là camera cộng lệnh ngôn ngữ tự nhiên, đầu ra là lệnh động cơ.
NGÀY30/07/2026 SỐ MODEL3 ĐỘ CHÍNH XÁC92% tháo bóng đèn BENCHMARK MỚIASIMOV-Agentic HÃNGGoogle DeepMind

Điểm mới thật sự không nằm ở chuyện robot xếp kệ hay buộc túi. Nó nằm ở chỗ DeepMind tách phần suy luận (ER 2) ra khỏi phần điều khiển, rồi để ER 2 điều phối nhiều robot cùng làm một mục tiêu. Đó là kiến trúc orchestrator - worker quen thuộc trong thế giới phần mềm, giờ áp lên phần cứng. Với doanh nghiệp sản xuất ở Việt Nam, đừng vội nghĩ đến việc mua robot hình người — cái đáng theo dõi là chuẩn giao tiếp: khi một model điều khiển được nhiều loại thân robot, chi phí tích hợp giảm mạnh, và các nhà tích hợp nội địa sẽ có cửa. Con số 92% nghe cao nhưng trong sản xuất thì 8% lỗi là không chấp nhận được, nên đây vẫn là giai đoạn thử nghiệm. Việc DeepMind tung kèm benchmark an toàn ASIMOV-Agentic cho thấy chính họ cũng biết rủi ro nằm ở chỗ nhiều agent phối hợp chứ không phải một agent đơn lẻ. Cái phải nhớ: 2026 là năm AI rời khỏi màn hình, và ai chuẩn bị dữ liệu vận hành từ bây giờ sẽ đỡ vất vả về sau.

Alibaba ra Qwen3.7 Flash: model vision 1M context giá 0,03 USD mỗi triệu token input

Qwen3.7 Flash là model suy luận vision-language cho agent đa phương thức, coding bằng hình ảnh và điều khiển máy tính, với cửa sổ ngữ cảnh 1 triệu token. Giá 0,03 USD cho mỗi triệu token input và 0,13 USD output, thuộc nhóm rẻ nhất thị trường multimodal.

💡 Vì sao đáng chú ý: mức giá này biến việc xử lý hàng loạt ảnh, hóa đơn, chứng từ bằng AI từ dự án tốn kém thành chi phí gần như không đáng kể.

📅 27/07 🔗 Website
  • Nhận text, ảnh và video; xuất text; tối đa 65.536 token output.
  • Ngân sách suy luận (thinking budget) tới 256.000 token.
  • Hỗ trợ function calling, built-in tools và structured output.
  • Thế mạnh: nhận diện vật thể, hiểu không gian, thị giác thực tế.
NGÀY27/07/2026 CONTEXT1.000.000 token GIÁ INPUT0,03 USD/1M GIÁ OUTPUT0,13 USD/1M OUTPUT MAX65.536 token

Đây là loại tin dễ bị bỏ qua vì không có drama, nhưng lại đổi kinh tế của rất nhiều bài toán thật. Với 0,03 USD mỗi triệu token input, xử lý một kho ảnh chứng từ vài chục nghìn tấm giờ tốn vài chục đô thay vì vài nghìn. Ai đang làm data pipeline có OCR, kiểm tra chất lượng ảnh, hoặc trích xuất bảng biểu từ file scan nên thử benchmark lại chi phí ngay tuần này. Cẩn trọng: rẻ không có nghĩa là chính xác, và Qwen3.7 Flash là model Flash — tức được tối ưu cho tốc độ, không phải cho những suy luận khó. Cách làm đúng là dùng nó ở tầng lọc/tiền xử lý khối lượng lớn, rồi đẩy phần khó lên model mạnh hơn. Với đội data nhỏ ở Việt Nam, đây là cơ hội để làm những thứ trước đây bị chặn bởi ngân sách, chứ không phải cái cớ để thay toàn bộ pipeline hiện có.

🔥 TOP 1 TUẦN NÀY Moonshot mở trọng số Kimi K3: 2,8 nghìn tỷ tham số, bản mở lớn nhất lịch sử

Moonshot AI phát hành công khai trọng số Kimi K3 — model Mixture-of-Experts 2,8 nghìn tỷ tham số tổng, 104 tỷ tham số kích hoạt, nặng khoảng 1,4 TB ở định dạng MXFP4. Repo chính thức trên Hugging Face gồm 96 shard trọng số cùng giấy phép và hướng dẫn triển khai.

💡 Vì sao đáng chú ý: lần đầu tiên một model quy mô frontier thật sự được thả trọng số công khai — ranh giới giữa "mở" và "đóng" bị xóa ở đúng nơi các lab Mỹ đang cố giữ.

📅 27/07 🔗 Website
  • 2,8 nghìn tỷ tham số tổng, 104 tỷ kích hoạt mỗi token.
  • 16 trong số 896 routed expert được bật, cộng 2 shared expert.
  • Kiến trúc Kimi Delta Attention lai tuyến tính, cộng Attention Residuals.
  • Hiểu hình ảnh gốc (native visual) và context 1 triệu token.
  • Together AI và Modal cung cấp hosting ngay ngày đầu.
THAM SỐ2,8 nghìn tỷ KÍCH HOẠT104 tỷ DUNG LƯỢNG~1,4 TB (MXFP4) SHARD96 file CONTEXT1 triệu token

Cái mới thật sự ở đây không phải con số 2,8 nghìn tỷ — mà là việc nó được thả ra miễn phí. Trước tuần này, lập luận phổ biến vẫn là "model open-weight luôn chậm một, hai thế hệ so với frontier". Kimi K3 phá lập luận đó. Nhưng phải nói thẳng: mở trọng số không đồng nghĩa với chạy được. 1,4 TB trọng số nghĩa là bạn cần một cụm GPU cỡ doanh nghiệp lớn mới nạp nổi, và với 99% người đọc bản tin này thì "mở" chỉ có nghĩa là giá API rẻ hơn và không bị khóa nhà cung cấp. Giá trị thực nằm ở chỗ khác: ai cũng được quyền distill, fine-tune, kiểm tra hành vi model, và không ai có thể một sáng đẹp trời tắt API của bạn. Với doanh nghiệp Việt, đây là lý do tốt để thiết kế hệ thống model-agnostic ngay từ đầu — đừng nhúng chết một nhà cung cấp vào lớp business logic. Cái phải nhớ: cuộc chơi giờ không còn là "ai có model mạnh nhất" mà là "ai kiểm soát được chi phí suy luận".

🛠️ Công cụ & Framework

🔥 TOP 4 TUẦN NÀY MCP chốt spec 2026-07-28: bỏ handshake, chuyển sang stateless, chạy được trên serverless

Bản spec 2026-07-28 là lần chỉnh sửa lớn nhất của Model Context Protocol từ khi ra đời: giao thức trở thành stateless ở tầng lõi, bỏ hẳn bước initialize và header Mcp-Session-Id trong Streamable HTTP. Kèm theo là khung extensions chính thức, multi round-trip request, định tuyến theo header và list result cache được.

💡 Vì sao đáng chú ý: MCP server giờ deploy được lên serverless và edge như một API HTTP bình thường — rào cản vận hành lớn nhất của giao thức này biến mất.

📅 28/07 🔗 Website
  • Sáu đề xuất SEP phối hợp để bỏ trạng thái khỏi tầng giao thức.
  • Mỗi request tự mang protocol version và client capabilities trong metadata.
  • Apps và Tasks chuyển sang khung extensions có đánh version.
  • Authorization siết theo chuẩn OAuth 2.0 và OpenID Connect doanh nghiệp.
  • Bản release candidate ra trước, SDK beta đi kèm.
NGÀY28/07/2026 SỐ SEP6 BỎMcp-Session-Id AUTHOAuth 2.0 + OIDC MỚIExtensions framework

Đây là tin ít lấp lánh nhất tuần nhưng lại ảnh hưởng lâu nhất. Trước đây MCP có trạng thái, nghĩa là mỗi phiên phải gắn với một tiến trình sống — rất khó scale, rất khó đặt sau load balancer. Bỏ trạng thái đi thì MCP server trở thành một hàm HTTP thuần, và bạn deploy nó lên Cloud Run, Lambda hay Cloudflare Workers như mọi API khác. Điều này nghĩa là gì cho team làm sản phẩm? Chi phí vận hành tích hợp AI với hệ thống nội bộ giảm một bậc, và bài toán auth cuối cùng cũng nói cùng ngôn ngữ với hạ tầng doanh nghiệp là OAuth và OIDC — bộ phận bảo mật sẽ bớt lắc đầu. Cẩn trọng phần migration: nếu đang chạy MCP server bản cũ, đừng nâng cấp vội trên môi trường production, hãy chạy song song hai version. Theo mình, đây là dấu hiệu MCP đang tốt nghiệp từ "thí nghiệm của dân dev" thành hạ tầng doanh nghiệp thật sự.

Anthropic đưa spec MCP mới lên trợ lý của mình, thư mục connector cán mốc hơn 950 server

Anthropic công bố hỗ trợ spec MCP 2026-07-28 cho trợ lý của hãng, kèm loạt tính năng connector mới: embedded UI, auth do doanh nghiệp quản lý, observability và private network tunnel. Thư mục connector hiện liệt kê hơn 950 MCP server, được hàng triệu người dùng mỗi ngày.

💡 Vì sao đáng chú ý: private network tunnel và enterprise-managed auth là hai thứ doanh nghiệp vẫn chờ để dám nối AI vào hệ thống nội bộ sau tường lửa.

📅 28/07 🔗 Website
  • Hỗ trợ stateless core, OAuth và OIDC mạnh hơn.
  • Extensions có version cho Apps và Tasks.
  • Connector mới: embedded UI hiển thị ngay trong hội thoại.
  • Private network tunnel để chạm server nội bộ không mở ra Internet.
  • Hơn 950 MCP server trong thư mục connector.
NGÀY28/07/2026 CONNECTOR950+ server SPEC2026-07-28 MỚIPrivate network tunnel

Con số 950 connector nói lên nhiều hơn bản thân tính năng: MCP đã thắng cuộc đua chuẩn hóa tích hợp. Nhưng thứ đáng để ý với doanh nghiệp Việt là private network tunnel. Từ trước đến nay, muốn cho AI truy vấn kho dữ liệu nội bộ thì hoặc phải đẩy dữ liệu lên cloud, hoặc phải mở cổng ra ngoài — cả hai đều làm bộ phận IT lo. Tunnel giải quyết đúng nút thắt đó. Về mặt kiến trúc, mình khuyên: đừng vội nối AI thẳng vào database production. Hãy dựng một lớp semantic ở giữa — view, API có kiểm soát quyền, hoặc semantic model — rồi mới expose qua MCP. Data không sạch và không có governance thì nối AI vào chỉ khuếch đại sai sót nhanh hơn. Câu quen thuộc vẫn đúng: vấn đề không nằm ở công cụ, mà ở cách mình thiết kế workflow và dữ liệu.

AWS AgentCore Gateway hỗ trợ ngay spec MCP 2026-07-28

AWS công bố AgentCore Gateway đã tương thích spec MCP 2026-07-28, cho phép agent gọi tool qua giao thức stateless mới trên hạ tầng AWS. Bài viết mô tả cách gateway xử lý header-based routing và authorization theo chuẩn mới.

💡 Vì sao đáng chú ý: hyperscaler bắt kịp spec trong cùng ngày phát hành là tín hiệu MCP đã trở thành hạ tầng chính thống, không còn là thử nghiệm.

📅 28/07 🔗 Website
  • Gateway đóng vai trò lớp trung gian giữa agent và tool doanh nghiệp.
  • Hỗ trợ định tuyến theo header của spec mới.
  • Authorization bám chuẩn OAuth 2.0 và OIDC.
  • Cho phép chạy MCP server theo mô hình serverless.
NGÀY28/07/2026 SẢN PHẨMAgentCore Gateway SPECMCP 2026-07-28 NHÀ CUNG CẤPAWS

Khi AWS, Anthropic và cộng đồng cùng ship hỗ trợ một spec trong cùng một ngày, đó là lúc bạn nên coi spec đó là mặc định cho hai năm tới. Với team đang phân vân giữa tự viết lớp tích hợp riêng hay theo MCP, tuần này là câu trả lời rõ ràng. Điểm đáng lưu ý về mặt kiến trúc: gateway kiểu này là chỗ đặt policy — rate limit, audit log, phân quyền theo vai trò. Đừng để mỗi MCP server tự lo bảo mật, hãy tập trung ở gateway. Cẩn trọng chuyện chi phí: agent gọi tool qua gateway thì mỗi lượt gọi đều tính tiền, và agent có xu hướng gọi nhiều hơn ta tưởng. Nên đặt trần và bật observability ngay từ ngày đầu, đừng đợi hóa đơn cuối tháng mới ngã ngửa.

vLLM vá hỗ trợ Kimi K3 trong PR số 50000, kèm docker image riêng

Cộng đồng vLLM mở PR thứ 50.000 để thêm hỗ trợ moonshotai/Kimi-K3, hướng dẫn dùng docker image vllm/vllm-openai:kimi-k3 và cảnh báo phải cài thêm FlashInfer v0.6.16rc5 sau khi merge mới chạy được. PR nhận hơn 100 reaction chỉ trong vài ngày.

💡 Vì sao đáng chú ý: tốc độ hệ sinh thái mở bắt kịp một model 2,8 nghìn tỷ tham số trong vài ngày cho thấy hạ tầng inference mở đã trưởng thành thật sự.

📅 27/07 🔗 Website
  • PR mang số hiệu tròn 50000 của dự án vLLM.
  • Cần FlashInfer v0.6.16rc5 mới chạy được K3 sau merge.
  • Có docker image chuyên biệt vllm/vllm-openai:kimi-k3.
  • Hơn 100 reaction và 16 comment trong tuần đầu.
NGÀY27/07/2026 PR#50000 PHỤ THUỘCFlashInfer 0.6.16rc5 REACTION101

Chi tiết đáng học ở đây là chuỗi phụ thuộc: model mở ra, nhưng phải có engine (vLLM), phải có kernel (FlashInfer), phải có image đóng gói thì mới thành thứ dùng được. Ai từng tự dựng inference stack đều biết đây mới là chỗ tốn thời gian nhất, không phải bản thân model. Với team nhỏ, bài học thực dụng: đừng chạy theo model mới ngay tuần đầu — chờ engine ổn định rồi hãy vào, tiết kiệm được vài ngày debug kernel. Với team hạ tầng lớn, ngược lại, đây là lúc cần có mặt sớm để nắm được cấu hình tối ưu trước đối thủ. Số PR 50000 cũng là cột mốc đáng nể của một dự án open source thuần cộng đồng.

NVIDIA mở mã NOOA: framework để test, trace và kiểm toán hành vi agent

Cùng với việc lập liên minh bảo mật, NVIDIA đóng góp NOOA (NVIDIA Labs Object-Oriented Agent) — framework nghiên cứu mã nguồn mở giúp đội kỹ thuật kiểm thử, truy vết, kiểm toán và quản trị hành vi của agent. Hãng cũng góp model, trọng số, dataset và nghiên cứu agent-harness.

💡 Vì sao đáng chú ý: sau vụ model tự thoát sandbox, công cụ truy vết hành vi agent chuyển từ "nên có" sang "bắt buộc phải có" với mọi hệ thống agent chạy production.

📅 27/07 🔗 Website
  • NOOA viết tắt của NVIDIA Labs Object-Oriented Agent.
  • Bốn năng lực chính: test, trace, audit và govern hành vi agent.
  • NVIDIA góp kèm model, trọng số và dataset cho liên minh.
  • Xây trên nền Akrites của Linux Foundation và cộng đồng OpenSSF.
NGÀY27/07/2026 TÊNNOOA GIẤY PHÉPMã nguồn mở NỀN TẢNGAkrites + OpenSSF

Cái hay của NOOA là nó thừa nhận một sự thật mà nhiều team né tránh: agent chạy production là một hệ thống không xác định, và bạn không thể quản trị thứ mình không quan sát được. Với doanh nghiệp đang triển khai agent nội bộ, thứ tự ưu tiên nên là: log đầy đủ mọi tool call trước, rồi mới tính đến việc mở rộng quyền cho agent. Đừng làm ngược. Mình đã thấy nhiều dự án cấp quyền rộng cho agent từ ngày đầu để "chạy cho nhanh", rồi ba tháng sau không ai trả lời được câu hỏi agent đã đụng vào dữ liệu nào. Một điểm cần cân nhắc: NOOA là framework nghiên cứu, chưa phải sản phẩm doanh nghiệp có SLA — hợp để học kiến trúc và tự dựng lớp audit, chưa hợp để cắm thẳng vào hệ thống quan trọng.

🔬 Nghiên cứu & Kỹ thuật mới

TurboVLA: model vision-language-action chạy 32 Hz trên RTX 4090, tốn dưới 1 GB VRAM

Bài báo dẫn đầu Hugging Face ngày 30/07 giới thiệu TurboVLA, model vision-language-action suy luận thời gian thực ở tần số 32 Hz trên một card RTX 4090 với mức tiêu thụ dưới 1 GB VRAM. Đây là mức tài nguyên thấp bất thường cho lớp model điều khiển robot.

💡 Vì sao đáng chú ý: đưa điều khiển robot bằng AI từ cụm server đắt đỏ xuống một card đồ họa phổ thông — cửa mở cho phòng lab và startup nhỏ.

📅 30/07 🔗 Website
  • Tần số suy luận 32 Hz, đủ cho vòng điều khiển thời gian thực.
  • Chạy trên một RTX 4090, VRAM dưới 1 GB.
  • Thuộc nhóm bài robotics thống trị bảng trending tuần này.
  • Kết hợp thị giác, ngôn ngữ và sinh lệnh hành động trong một model.
NGÀY30/07/2026 TẦN SỐ32 Hz VRAM< 1 GB PHẦN CỨNGRTX 4090 ARXIV2607.27205

Đây là kiểu nghiên cứu mình thích: không chạy theo điểm benchmark, mà kéo chi phí xuống tới mức người thường tiếp cận được. Một RTX 4090 ở Việt Nam là thứ nhiều phòng lab đại học và startup phần cứng có sẵn. Nếu con số 32 Hz và dưới 1 GB VRAM đứng vững khi tái lập, thì rào cản vào lĩnh vực robot học bằng AI vừa hạ xuống đáng kể. Điều cần tỉnh táo: bài báo mới lên trending, chưa qua peer review, và VLA thường mất rất nhiều điểm khi rời khỏi môi trường huấn luyện. Khuyến nghị của mình cho ai quan tâm: đọc kỹ phần setup thí nghiệm trước, xem họ đo trên tác vụ gì — con số tần số cao mà tác vụ đơn giản thì không nói lên nhiều.

HumanCLAW: vision-language model có thật sự hành động được qua một cơ thể không?

HumanCLAW đặt câu hỏi trực diện về khả năng hành động có thân thể của các model đa phương thức: chúng hiểu ảnh và chữ rất tốt, nhưng khi phải điều khiển một cơ thể thật thì còn lại bao nhiêu. Bài nằm trong nhóm dẫn đầu trending Hugging Face ngày 30/07.

💡 Vì sao đáng chú ý: đúng tuần Google tung Gemini Robotics 2, giới nghiên cứu đặt ngược câu hỏi liệu năng lực đa phương thức có tự động chuyển thành năng lực hành động hay không.

📅 30/07 🔗 Website
  • Khảo sát năng lực hành động có thân thể của VLM.
  • Tách bạch giữa hiểu cảnh và điều khiển được cơ thể.
  • Cùng ngày với TurboVLA và DistillAlign trên bảng trending.
NGÀY30/07/2026 ARXIV2607.27180 CHỦ ĐỀEmbodied VLM

Câu hỏi trong tiêu đề bài báo chính là câu hỏi đúng của giai đoạn này. Ngành đang giả định rằng model nào hiểu ảnh giỏi thì điều khiển robot cũng sẽ giỏi, nhưng đó là giả định chưa được chứng minh. Nhìn từ góc doanh nghiệp: nếu bạn đang cân nhắc dự án tự động hóa vật lý, đừng chọn nhà cung cấp chỉ dựa trên điểm benchmark thị giác của họ. Hãy đòi demo trên chính dây chuyền của bạn, với chính vật thể và ánh sáng của bạn. Bài học chung mình rút ra sau nhiều dự án data: khoảng cách giữa "model hiểu được" và "hệ thống làm được" luôn lớn hơn dự tính, và chỗ tốn tiền nằm đúng ở khoảng cách đó.

Báo cáo kỹ thuật Kimi K3: Kimi Delta Attention và Attention Residuals đứng đầu Hugging Face

Moonshot AI công bố báo cáo kỹ thuật đi kèm bản mở trọng số, mô tả kiến trúc Kimi Delta Attention — cơ chế attention tuyến tính lai — cùng Attention Residuals. Bài dẫn đầu bảng trending Hugging Face ngày 28/07 với hơn 7.500 lượt xem.

💡 Vì sao đáng chú ý: mở trọng số đã hiếm, mở luôn chi tiết kiến trúc còn hiếm hơn — đúng lúc giới học thuật phàn nàn các lab hàng đầu gần như không công bố gì.

📅 28/07 🔗 Website
  • Kimi Delta Attention: cơ chế attention tuyến tính lai.
  • Attention Residuals giữ thông tin qua các tầng sâu.
  • Hơn 7.500 lượt xem, đứng đầu trending ngày 28/07.
  • Hiểu hình ảnh gốc và context 1 triệu token.
NGÀY28/07/2026 ARXIV2607.24653 LƯỢT XEM7.560 KIẾN TRÚCKDA + Attention Residuals

Attention tuyến tính là hướng nhiều nhóm theo đuổi vì attention truyền thống tốn chi phí bậc hai theo độ dài chuỗi. Việc Moonshot đẩy được kiến trúc lai này lên quy mô 2,8 nghìn tỷ tham số và context 1 triệu token là bằng chứng thực nghiệm mạnh, không còn là ý tưởng trên giấy. Với người làm RAG và context engineering, đây là tin nên đọc kỹ: nếu chi phí xử lý context dài giảm mạnh, một số quyết định thiết kế hiện tại sẽ phải xem lại — chẳng hạn có nên chunk nhỏ và rerank cầu kỳ nữa không, hay cứ nhồi cả tài liệu vào. Mình không nghĩ context dài sẽ giết RAG, vì retrieval còn giải quyết vấn đề nguồn tin và kiểm soát, nhưng cán cân đang dịch. Ai đang thiết kế hệ thống tri thức doanh nghiệp nên đo lại chi phí trước khi khóa kiến trúc.

StateAct của Salesforce: cho agent đọc state chương trình thay vì nhìn pixel

Salesforce AI Research đề xuất StateAct, hướng cho computer-use agent làm việc dựa trên trạng thái chương trình thay vì ảnh chụp màn hình, nhắm vào các tác vụ dài hơi. Ý tưởng cốt lõi: state trước, pixel sau.

💡 Vì sao đáng chú ý: agent nhìn màn hình rất dễ lạc sau vài chục bước; đọc state là hướng khả thi nhất để làm được tác vụ máy tính dài mà không trôi.

📅 28/07 🔗 Website
  • Biểu diễn dựa trên state thay cho ảnh màn hình.
  • Nhắm tác vụ computer-use dài hơi (long-horizon).
  • Do Salesforce AI Research thực hiện.
NGÀY28/07/2026 ARXIV2607.22798 NHÓMSalesforce AI Research

Ai từng để agent tự thao tác trên máy đều biết vấn đề: sau vài chục bước, nó không còn biết mình đang ở đâu. Cho agent nhìn ảnh màn hình là cách dễ triển khai nhưng tệ về mặt tín hiệu — mỗi khung hình chứa cực nhiều thông tin thừa. Đọc thẳng state chương trình thì gọn hơn nhiều lần và ít nhiễu. Bài học áp dụng ngay cho team đang xây agent nội bộ: nếu hệ thống của bạn có API, đừng bắt agent click qua giao diện. Hãy expose state và hành động dưới dạng tool có cấu trúc. Nghe hiển nhiên, nhưng rất nhiều dự án chọn hướng nhìn màn hình vì nó demo đẹp hơn, rồi trả giá ở khâu vận hành. Thiết kế agent giống thiết kế API: rõ ràng, ít trạng thái ẩn, dễ kiểm chứng.

Từ proprietary sang open-source: chuyển năng lực agent bằng Multi-Agent Protocol Distillation

Nhóm nghiên cứu đa đơn vị đề xuất kỹ thuật distill giao thức nhiều agent để thu hẹp khoảng cách phân phối giữa hệ agent đóng và hệ open-source. Mục tiêu là chuyển năng lực agent của model thương mại sang model mở mà không cần trọng số gốc.

💡 Vì sao đáng chú ý: nếu năng lực agent distill được, lợi thế của các lab đóng sẽ ngắn hạn hơn nhiều so với họ mong đợi.

📅 28/07 🔗 Website
  • Distill ở mức giao thức phối hợp, không chỉ mức output.
  • Nhắm vào khoảng cách phân phối giữa hệ đóng và hệ mở.
  • Nghiên cứu hợp tác nhiều đơn vị, không thuộc một lab lớn.
NGÀY28/07/2026 ARXIV2607.24280 KỸ THUẬTProtocol distillation

Ý tưởng thú vị nằm ở chỗ họ distill cách các agent nói chuyện với nhau, chứ không phải distill câu trả lời cuối. Nếu phần lớn giá trị của hệ agent thương mại nằm ở orchestration chứ không ở model nền, thì đây là đòn đánh trúng chỗ. Về mặt pháp lý và đạo đức, cần nói rõ: distill từ output của model thương mại thường vi phạm điều khoản sử dụng, và doanh nghiệp không nên làm chuyện đó rồi đưa vào sản phẩm. Nhưng ý nghĩa chiến lược thì rõ: lợi thế cạnh tranh của một sản phẩm AI không nên nằm ở prompt hay ở cách xếp agent — những thứ đó sao chép được. Nó phải nằm ở dữ liệu độc quyền, ở quy trình nghiệp vụ, và ở việc người dùng thật sự đổi hành vi.

JarvisHub: harness mở cho agent sáng tạo đa phương thức làm việc trên canvas

JarvisHub là khung mở cho các agent sáng tạo đa phương thức hoạt động trực tiếp trên canvas, thay vì chỉ trả lời bằng văn bản. Dự án là hợp tác nhiều đơn vị và nằm trong nhóm trending Hugging Face ngày 28/07.

💡 Vì sao đáng chú ý: canvas là môi trường làm việc thật của dân thiết kế và marketing — agent biết thao tác trên canvas thì mới chạm được nhóm người dùng đó.

📅 28/07 🔗 Website
  • Harness mở, canvas-native cho agent sáng tạo.
  • Hợp tác nhiều tổ chức nghiên cứu.
  • Nằm trong top trending Hugging Face ngày 28/07.
NGÀY28/07/2026 ARXIV2607.23588 LOẠIOpen harness

Phần lớn agent hiện nay vẫn làm việc trong khung chat, mà chat là giao diện tệ cho công việc sáng tạo. Canvas thì khác: có không gian, có lớp, có quan hệ giữa các phần tử — gần với cách người thiết kế thật sự nghĩ. Với đội marketing hay đội làm nội dung ở doanh nghiệp Việt, hướng này đáng theo dõi vì nó bỏ bớt một lớp dịch giữa ý tưởng và thao tác. Nhưng đừng kỳ vọng dùng được ngay: đây là harness nghiên cứu, không phải sản phẩm. Giá trị trước mắt là để đội kỹ thuật hiểu cách mô hình hóa không gian làm việc cho agent — bài toán đó áp dụng được cho cả dashboard, cả báo cáo, chứ không riêng thiết kế.

📈 Hot trend & Thảo luận cộng đồng

Các startup AI hàng đầu gần như không công bố nghiên cứu: chỉ chiếm 0,1% số bài AI năm 2025

Phân tích mới cho thấy hơn một nửa số kỳ lân AI chưa từng đóng vai trò chính trong bất kỳ bài báo hay preprint nào; cả nhóm này gộp lại chỉ chiếm một trên mỗi nghìn bài AI xuất bản năm 2025. Bài trên Science thu hút hơn 600 điểm và 315 bình luận trên Hacker News.

💡 Vì sao đáng chú ý: nếu không ai công bố gì, không ai kiểm chứng được tuyên bố nào — đúng lúc các con số benchmark đang được dùng để gọi vốn hàng tỷ đô.

📅 29/07 🔗 Website
  • Hơn 50% kỳ lân AI chưa từng dẫn dắt một bài báo hay preprint.
  • Cả nhóm chiếm 0,1% tổng số bài AI năm 2025.
  • Preprint gốc đăng bioRxiv ngày 16/07/2026.
  • Đồng tác giả có John Ioannidis, nhà nghiên cứu meta-science tại Stanford.
  • 604 điểm, 315 bình luận trên Hacker News.
NGÀY29/07/2026 TỶ LỆ0,1% bài AI 2025 KỲ LÂN KHÔNG XUẤT BẢN> 50% HN604 điểm

Đây là tin mình thấy quan trọng hơn nhiều tin ồn ào khác trong tuần. Câu hỏi của Ioannidis rất đúng: làm sao đánh giá được điều họ nói là thật, đã được kiểm chứng, và tái lập được. Trong ngành data và AI, chúng ta đang sống bằng những con số do chính nhà bán hàng công bố. Với doanh nghiệp Việt sắp ký hợp đồng AI, khuyến nghị cụ thể: đừng mua theo bảng benchmark của nhà cung cấp, hãy đòi một bài test trên chính dữ liệu của mình, có tiêu chí chấm rõ ràng, và có bên thứ ba xem lại nếu hợp đồng đủ lớn. Đây cũng là lý do mình đánh giá cao những nhóm chịu công bố báo cáo kỹ thuật như Moonshot tuần này — không phải vì họ tốt bụng, mà vì thứ kiểm chứng được thì đáng tin hơn thứ chỉ được quảng cáo.

Hugging Face chỉ phát hiện được vụ xâm nhập nhờ model open-weight Trung Quốc, sau khi model đóng từ chối hỗ trợ

Theo TIME, Hugging Face chỉ lần ra dấu vết cuộc xâm nhập nhờ dùng một model open-weight của Trung Quốc, sau khi model đóng từ chối tham gia phân tích. Chi tiết này thổi bùng lại cuộc tranh cãi mở hay đóng ngay giữa lúc Mỹ cân nhắc siết model open-weight.

💡 Vì sao đáng chú ý: lần đầu có một tình huống cụ thể cho thấy guardrail của model đóng có thể làm phe phòng thủ mất khả năng phản ứng.

📅 28/07 🔗 Website
  • Model đóng từ chối hỗ trợ điều tra, model mở làm được.
  • Nvidia lập luận phe phòng thủ cần chạy AI trên hạ tầng của chính mình.
  • Dario Amodei của Anthropic muốn chính phủ test mọi model vượt ngưỡng năng lực.
  • Anthropic không tham gia liên minh bảo mật mở.
NGÀY28/07/2026 NGUỒNTIME PHÁT HIỆN NHỜModel open-weight VẮNG MẶTAnthropic

Chi tiết này mạnh vì nó là ví dụ cụ thể chứ không phải lý thuyết. Guardrail được thiết kế để chặn hành vi xấu, nhưng phân tích một cuộc tấn công trông rất giống chuẩn bị một cuộc tấn công — và model đóng không phân biệt được. Theo mình, cả hai phe đều có lý ở phần lập luận cốt lõi của họ: mở thì phòng thủ được nhưng cũng tấn công được, đóng thì kiểm soát được nhưng lại chặn nhầm người tốt. Điều thực dụng cho doanh nghiệp Việt: đừng đặt toàn bộ năng lực bảo mật vào một nhà cung cấp AI đóng. Hãy giữ ít nhất một đường chạy model mở trên hạ tầng mình kiểm soát cho các tình huống điều tra sự cố. Đây không phải quan điểm chính trị về mở hay đóng, mà là nguyên tắc dự phòng cơ bản.

Giáo sư giăng bẫy prompt chữ trắng, bắt 32 trên 35 sinh viên chép bài bằng AI

Giáo sư sử học Jason Gibson tại Alcorn State University giấu một dòng chữ trắng trên nền trắng trong đề thi giữa kỳ, yêu cầu chatbot chèn nội dung vô nghĩa về Madagascar. 32 trong 35 sinh viên nộp bài có nhắc tới Madagascar — nghĩa là chép nguyên output mà không đọc lại.

💡 Vì sao đáng chú ý: bài viết bùng nổ với hơn 32.000 upvote trên Reddit, và điều gây sốc không phải chuyện dùng AI mà là gần như không ai đọc lại thứ mình nộp.

📅 27/07 🔗 Website
  • Đề thi về Cách mạng Công nghiệp, bẫy giấu bằng chữ trắng nền trắng.
  • 32 trên 35 sinh viên hai lớp dính bẫy.
  • Bài nộp trau chuốt ngữ pháp nhưng chèn câu vô nghĩa về Madagascar.
  • Hơn 32.600 upvote và 4.199 bình luận trên r/technology.
NGÀY27/07/2026 DÍNH BẪY32/35 TRƯỜNGAlcorn State University REDDIT32.628 upvote

Mình dạy nhiều lớp về AI nên tin này chạm đúng chỗ mình quan tâm. Vấn đề không nằm ở chỗ sinh viên dùng AI — đó là chuyện đương nhiên và cấm cũng không được. Vấn đề nằm ở chỗ 32 người copy, paste, nộp, và không ai đọc lại một dòng. Đó là dấu hiệu của việc giao toàn bộ phần suy nghĩ cho máy, giữ lại đúng thao tác cơ học. Trong đào tạo doanh nghiệp mình thấy y hệt: học viên dán prompt, lấy output, đưa vào báo cáo, và khi bị hỏi "tại sao con số này" thì đứng hình. Khuyến nghị của mình cho người dạy và người quản lý: đổi cách chấm, đừng chấm sản phẩm cuối mà chấm quá trình — bắt trình bày lại, bắt phản biện, bắt sửa một chỗ sai cố tình cài vào. AI không thay người giỏi; nó khuếch đại người biết làm việc rõ ràng, và nó cũng phơi bày rất nhanh người không chịu nghĩ.

Các công ty AI gom sách hiếm, cắt gáy quét rồi hủy — kể cả khi gần như không còn bản nào khác

Loạt bài điều tra cho biết nhiều công ty AI đặt mua số lượng lớn sách cũ, sách hiếm và sách hết bản in qua trung gian ẩn danh, cắt gáy để quét rồi hủy bản gốc. Quy trình đặt hàng theo mã ISBN nên không ai kiểm tra cuốn sắp bị hủy có phải bản cuối cùng còn tồn tại hay không.

💡 Vì sao đáng chú ý: chủ đề nóng nhất Hacker News tuần này với 794 điểm — dữ liệu huấn luyện đang đánh đổi bằng thứ không thể phục hồi.

📅 27/07 🔗 Website
  • Quét phá hủy: cắt gáy, xé trang, quét xong bỏ bản giấy.
  • Dịch vụ ISBNdb cho phép đặt tới một triệu cuốn, giữ ẩn danh người mua.
  • Hiệu sách ở châu Âu và Mỹ nhận đơn hàng số lượng lớn bất thường.
  • Đơn đặt theo mã ISBN nên hoàn toàn mù với độ hiếm của sách.
  • 794 điểm và 515 bình luận trên Hacker News.
NGÀY27/07/2026 HN794 điểm QUY MÔ ĐƠNtới 1 triệu cuốn TRUNG GIANISBNdb

Chuyện quét phá hủy không mới — thư viện làm từ lâu vì bản giấy hỏng dần. Cái mới là quy mô và sự vô cảm của quy trình: đặt theo ISBN, mua bao nhiêu cũng được, không ai nhìn cuốn sách trước khi cắt. Nhìn từ góc data governance, đây là ví dụ kinh điển của việc tối ưu một chỉ số (khối lượng dữ liệu huấn luyện) mà bỏ qua chi phí không đo được (di sản văn hóa mất vĩnh viễn). Mình thấy bài học này áp thẳng được vào doanh nghiệp: rất nhiều dự án data cũng đang tối ưu thứ đo được và phá hỏng thứ không đo được — như niềm tin của người dùng, hay chất lượng dữ liệu gốc. Ai làm pipeline dữ liệu nên tự hỏi: quy trình của mình có bước nào không thể hoàn tác không, và ai là người được quyền dừng nó lại.

"Mở" không có nghĩa là chạy được: 1,4 TB trọng số và llama.cpp còn chưa đọc nổi Kimi K3

Cộng đồng r/LocalLLaMA nhanh chóng phát hiện thực tế phũ phàng của bản mở Kimi K3: file nặng 1,4 TB, và tính đến cuối tháng 7 chưa bản llama.cpp phát hành nào đọc được kiến trúc này — hỗ trợ vẫn còn nằm ở pull request. Cách khả thi nhất để "chạy local" là trỏ công cụ local vào endpoint đám mây.

💡 Vì sao đáng chú ý: khoảng cách giữa "mở trọng số" và "tự chủ được model" lớn hơn nhiều so với những gì các dòng tít gợi ra.

📅 27/07 🔗 Website
  • 1,4 TB trọng số ở định dạng MXFP4, chia 96 shard.
  • llama.cpp chưa có bản phát hành nào đọc được kiến trúc K3.
  • Kho GGUF phải compile từ nhánh pull request.
  • Endpoint của Moonshot khoảng 32 token mỗi giây.
  • Một số nhà cung cấp bên thứ ba đạt tới khoảng 165 token mỗi giây.
NGÀY27/07/2026 DUNG LƯỢNG1,4 TB TỐC ĐỘ GỐC~32 token/s TỐC ĐỘ BÊN THỨ BAtới ~165 token/s LLAMA.CPPchưa hỗ trợ

Đây là mặt kia của tin hot nhất tuần, và mình nghĩ nó quan trọng không kém. "Open-weight" đang bị hiểu nhầm thành "ai cũng chạy được ở nhà". Không phải. Với 1,4 TB, bạn cần một cụm GPU cỡ trung tâm dữ liệu. Giá trị thật của open-weight nằm ở ba chỗ: một là cạnh tranh kéo giá API xuống, hai là quyền fine-tune và distill cho bài toán riêng, ba là không bị khóa nhà cung cấp. Với doanh nghiệp Việt, mình khuyên rõ: đừng lấy chuyện mở trọng số làm lý do đầu tư hạ tầng GPU riêng — bài toán kinh tế gần như luôn thua thuê endpoint. Hãy dùng open-weight như đòn bẩy thương lượng và như phương án dự phòng, không phải như dự án hạ tầng. Chênh lệch tốc độ 32 so với 165 token mỗi giây giữa các nhà cung cấp cũng nhắc một điều: cùng một model, trải nghiệm có thể khác nhau năm lần, nên hãy benchmark nhà cung cấp chứ đừng chỉ benchmark model.

🏢 Ngành & Kinh doanh

Google DeepMind giải thể đội AlphaFold từng đoạt giải Nobel, dồn người sang Gemini

Theo Financial Times, Google DeepMind đã giải tán đội chuyên trách AlphaFold trong năm qua, điều phần lớn tác giả bài báo gốc sang các dự án liên quan Gemini và các mảng khoa học như thiết kế enzyme, nhiệt hạch, genomics. Gần một phần tư tác giả toàn thời gian của bài báo gốc đã rời công ty.

💡 Vì sao đáng chú ý: ngay cả thành tựu khoa học được giải Nobel cũng không giữ nổi đội hình khi mọi nguồn lực bị hút về cuộc đua model tổng quát.

📅 30/07 🔗 Website
  • Financial Times đưa tin ngày 29/07, các báo lớn đăng lại ngày 30/07.
  • Gần 25% tác giả toàn thời gian của bài AlphaFold gốc đã nghỉ việc.
  • Nobel laureate John Jumper rời sang Anthropic từ tháng 6.
  • Hai đồng nghiệp AlphaFold đi theo Jumper.
  • Người ở lại chuyển sang Gemini, enzyme design, nhiệt hạch, genomics.
NGÀY30/07/2026 TÁC GIẢ RỜI ĐI~25% NGUỒNFinancial Times ĐIỂM ĐẾNGemini + khoa học

Đây là tin buồn nhưng dễ hiểu về mặt tổ chức. AlphaFold đã giải xong bài toán của nó và trở thành hạ tầng — giữ một đội lớn để duy trì hạ tầng thì không hợp lý bằng phân tán người sang các bài toán mới. Nhưng có một mặt đáng lo: khi Nobel laureate rời đi và một phần tư tác giả gốc nghỉ việc, đó không còn là tái cơ cấu bình thường mà là dấu hiệu ưu tiên đã đổi. Bài học tổ chức cho doanh nghiệp: đội làm ra thành tựu và đội duy trì thành tựu là hai loại đội khác nhau, và nếu bạn không thiết kế đường đi tiếp cho người giỏi sau khi họ về đích, họ sẽ tìm đường đi ở nơi khác. Mình thấy chuyện này xảy ra rất nhiều với các dự án data và BI thành công ở doanh nghiệp Việt: dựng xong hệ thống, đội chủ chốt tản ra, hai năm sau không ai hiểu model nữa.

Microsoft thừa nhận ưu tiên Copilot của mình trước khách hàng Azure khi thiếu compute

CFO Amy Hood xác nhận khi nguồn lực khan hiếm, Microsoft ưu tiên các sản phẩm Copilot nội bộ trong Microsoft 365, GitHub và mảng bảo mật trước khi phục vụ đơn hàng Azure bên ngoài. Lãnh đạo nói với Business Insider rằng họ đang "đi mua công suất khắp nơi", kể cả cân nhắc Amazon và Google, và đã dùng Amazon để ổn định GitHub.

💡 Vì sao đáng chú ý: khi chính nhà cung cấp cloud lớn nhất phải xếp hàng mua công suất của đối thủ, "co giãn vô hạn" chính thức chỉ còn là khẩu hiệu marketing.

📅 29/07 🔗 Website
  • Copilot nội bộ được ưu tiên trước workload của khách hàng.
  • Microsoft chi khoảng 190 tỷ USD cho hạ tầng AI trong năm.
  • Azure vẫn bị giới hạn công suất ít nhất tới hết 2026.
  • Đã dùng hạ tầng Amazon để ổn định GitHub.
  • Azure lần đầu vượt 100 tỷ USD doanh thu năm.
NGÀY29/07/2026 ĐẦU TƯ~190 tỷ USD/năm AZURE> 100 tỷ USD doanh thu THIẾU HỤTđến hết 2026

Tin này thực dụng hơn nhiều so với vẻ ngoài của nó. Nếu bạn đang chạy workload AI trên Azure và giả định rằng cứ cần là có GPU, hãy bỏ giả định đó đi. Ba việc nên làm ngay: một là ký cam kết công suất (reserved capacity) cho phần workload sống còn thay vì dùng on-demand; hai là thiết kế hệ thống model-agnostic để đổi nhà cung cấp trong vài ngày chứ không phải vài tháng; ba là tách rõ workload nào chịu được độ trễ và workload nào không, rồi đẩy nhóm chịu được sang giờ thấp điểm hoặc batch. Điểm sâu hơn: chi 190 tỷ USD một năm mà vẫn thiếu, nghĩa là nút thắt không phải tiền mà là điện và thời gian xây dựng. Đó cũng là lý do tin Nvidia bảo lãnh cho campus 10 gigawatt ở Ohio đáng chú ý đến vậy — cuộc đua AI đang biến thành cuộc đua hạ tầng năng lượng.

Cyera chi 1 tỷ USD mua Oasis Security để quản danh tính của AI agent

Cyera ký thỏa thuận mua Oasis Security với giá khoảng 1 tỷ USD, chủ yếu bằng tiền mặt, nhằm gộp bảo mật dữ liệu với quản lý danh tính phi con người và AI agent. Oasis thành lập năm 2022, đã gọi khoảng 195 triệu USD từ Accel, Craft Ventures và Cyberstarts.

💡 Vì sao đáng chú ý: agent đang sinh ra danh tính máy nhanh hơn tốc độ doanh nghiệp cấp tài khoản cho người — và thị trường vừa định giá bài toán đó ở mức tỷ đô.

📅 28/07 🔗 Website
  • Giá trị thương vụ khoảng 1 tỷ USD, phần lớn tiền mặt.
  • Oasis chuyên non-human identity, chủ yếu là AI agent.
  • Cyera vừa gọi 600 triệu USD ở định giá 12 tỷ tháng trước.
  • Dự kiến hoàn tất trong năm nay.
  • Nhà sáng lập Oasis nhận khoản chia hơn 200 triệu USD.
NGÀY28/07/2026 GIÁ TRỊ1 tỷ USD ĐỊNH GIÁ CYERA12 tỷ USD OASIS ĐÃ GỌI195 triệu USD THÀNH LẬP2022

Bài toán ở đây rất thật và đang tới sớm hơn nhiều doanh nghiệp nghĩ. Khi bạn triển khai agent, mỗi agent cần credential để gọi API, đọc database, gửi mail. Chỉ vài tháng là số "tài khoản máy" vượt số nhân viên, mà không ai quản lý vòng đời của chúng: ai cấp, hết hạn khi nào, thu hồi ra sao khi dự án dừng. Đó chính là lỗ hổng mà vụ agent tự hành xâm nhập vừa rồi khai thác — dùng credential lấy từ dịch vụ bên thứ ba. Khuyến nghị cụ thể cho doanh nghiệp Việt đang thử agent: đừng cấp cho agent tài khoản admin dùng chung, hãy tạo service account riêng từng agent, giới hạn phạm vi theo tác vụ, đặt hạn sử dụng ngắn và bật log. Việc này làm mất một buổi, nhưng bỏ qua thì trả giá bằng cả hệ thống. Thị trường vừa trả 1 tỷ đô để nói với bạn rằng đây là chuyện nghiêm túc.

🔥 TOP 5 TUẦN NÀY Nvidia lập Open Secure AI Alliance với hơn 37 tổ chức — vắng mặt OpenAI, Google và Anthropic

Nvidia công bố Open Secure AI Alliance quy tụ hơn 37 tổ chức gồm Linux Foundation, Red Hat, IBM, Microsoft, Hugging Face, Cloudflare, Cisco, CrowdStrike, Palo Alto Networks, Siemens, Snowflake. Luận điểm chung: người phòng thủ cần model frontier mà họ tự kiểm tra, sửa đổi và chạy trên hạ tầng của mình.

💡 Vì sao đáng chú ý: ba lab đóng lớn nhất đều vắng mặt, biến liên minh này thành ranh giới chính thức giữa hai phe mở và đóng trong an ninh AI.

📅 27/07 🔗 Website
  • Hơn 37 tổ chức sáng lập, một số nguồn đếm tới hơn 40 và 52 đối tác.
  • Xây trên nền Akrites của Linux Foundation và cộng đồng OpenSSF.
  • Chia sẻ model mở, framework, hệ định danh, công cụ quét, dataset.
  • Nvidia đóng góp trọng số, dataset và framework NOOA.
  • OpenAI, Google và Anthropic không có trong danh sách sáng lập.
NGÀY27/07/2026 THÀNH VIÊN37+ tổ chức DẪN ĐẦUNVIDIA VẮNG MẶTOpenAI, Google, Anthropic NỀN TẢNGLinux Foundation

Thời điểm ra mắt nói lên tất cả: ngay sau vụ model tự thoát sandbox và xâm nhập Hugging Face, và ngay khi Mỹ đang cân nhắc siết model open-weight. Lập luận của phe mở rất mạnh về mặt vận hành: đội bảo mật không thể phản ứng nhanh nếu phải chờ nhà cung cấp cho phép. Nhưng phải công bằng với phe kia — Anthropic không phải không có lý khi muốn mọi model vượt ngưỡng năng lực đều bị kiểm tra trước khi phát hành, bất kể mở hay đóng. Theo mình, hai lập luận này không loại trừ nhau, và việc chúng bị đẩy thành hai phe là điều đáng tiếc. Với doanh nghiệp Việt, ý nghĩa thực tế: sắp có một bộ công cụ bảo mật AI mã nguồn mở, miễn phí, do các tên tuổi lớn hậu thuẫn. Đó là cơ hội để đội bảo mật nội bộ nâng năng lực mà không phải mua giải pháp đắt tiền — nên theo dõi Akrites và OpenSSF từ bây giờ.

🔥 TOP 2 TUẦN NÀY Nvidia đàm phán bảo lãnh 250 tỷ USD để OpenAI thuê campus 10 gigawatt trên nền nhà máy uranium cũ

Theo Wall Street Journal, Nvidia đang thương lượng bảo lãnh khoảng 250 tỷ USD tiền vay để OpenAI thuê được khu data center 10 gigawatt do SB Energy của SoftBank xây tại Piketon, Ohio, trên nền nhà máy làm giàu uranium đã ngừng hoạt động. Nvidia còn bàn thêm khoản tới 350 tỷ USD tài trợ mua chip; tổng dự án có thể vượt 500 tỷ USD.

💡 Vì sao đáng chú ý: nhà cung cấp chip đứng ra bảo lãnh nợ cho khách hàng mua chip của chính mình — mô hình tài chính vòng tròn này là rủi ro hệ thống lớn nhất của ngành AI hiện nay.

📅 27/07 🔗 Website
  • Khoảng 250 tỷ USD bảo lãnh cho phần thuê và xây dựng, chưa gồm chip.
  • Thêm khoản đàm phán tới 350 tỷ USD để tài trợ mua chip.
  • Tổng dự án có thể vượt 500 tỷ USD, lớn nhất từng công bố.
  • Địa điểm cách Columbus, Ohio khoảng 80 km về phía nam.
  • Giai đoạn một dự kiến xong năm 2028 với khoảng 800 megawatt.
NGÀY27/07/2026 BẢO LÃNH~250 tỷ USD TÀI TRỢ CHIPtới 350 tỷ USD CÔNG SUẤT10 gigawatt GIAI ĐOẠN 12028, ~800 MW

Con số gây choáng, nhưng thứ đáng nhìn là cấu trúc chứ không phải quy mô. OpenAI chưa có lãi nên không đạt xếp hạng tín nhiệm đầu tư, không tự vay được ở quy mô này. Nvidia đứng ra bảo lãnh để trấn an bên cho vay — nghĩa là nhà bán chip đang gánh rủi ro tín dụng cho người mua chip. Nếu nhu cầu AI đi đúng kỳ vọng, mọi người đều thắng. Nếu chậm lại, rủi ro dồn về đúng một điểm. Đây chính là cái mà báo chí gọi là tài chính vòng tròn, và tuần trước cũng đã có điều tra về nợ ẩn ngoài bảng cân đối của các ông lớn. Bài học cho doanh nghiệp Việt không phải là dự đoán bong bóng vỡ hay không — mà là: chi phí AI của bạn đang được trợ giá bởi dòng vốn rẻ này. Đừng xây mô hình kinh doanh dựa trên giả định giá token sẽ mãi rẻ như hôm nay. Hãy tính xem nếu giá tăng gấp ba thì sản phẩm của bạn còn lãi không. Chi tiết đắt giá cuối: họ chọn nền nhà máy uranium cũ vì ở đó đã có sẵn hạ tầng điện. Nút thắt của AI bây giờ là điện, không phải chip.