Databricks bật bản beta cho phép đọc change data feed trực tiếp từ materialized view tạo bằng Lakeflow hoặc SQL, thêm luồng REPLACE USING để thay thế snapshot từng phần theo cột khoá, và cho phép chạy task JAR Scala/Java trên serverless mà không cần dựng cluster.
💡 Ba mảnh này gỡ đúng ba chỗ đau kinh điển của pipeline: materialized view trước nay là ngõ cụt vì không đọc được delta phía sau, snapshot đổ đầy bảng mỗi lần chạy, và job JVM luôn phải chờ cluster khởi động.
- Change data feed trên materialized view: bản Beta, áp dụng cho MV tạo bằng Lakeflow hoặc SQL.
- REPLACE USING flows (Beta): thay thế snapshot từng phần, khoá theo cột chỉ định.
- JAR task trên serverless: chạy Scala/Java không cần provision cluster.
- Tìm và thay thế đa file trong Git folders, tiện refactor pipeline hàng loạt.
- Lakebase hỗ trợ workspace có kiểm soát HIPAA, C5 hoặc TISAX.
Đây là loại release note ít ai đọc nhưng lại đổi cách dựng pipeline. Trước đây, materialized view của Databricks tiện cho tầng phục vụ nhưng bịt đường downstream: muốn biết cái gì vừa đổi thì phải so bảng hoặc chạy lại từ đầu. Có change data feed, MV trở thành một mắt xích thật trong chuỗi incremental. REPLACE USING thì cứu những team làm việc với nguồn chỉ trả snapshot từng phần, ví dụ ERP xuất theo chi nhánh hoặc theo kỳ. Trước đây phải viết logic merge thủ công và cầu trời không sót khoá. JAR trên serverless là món tiết kiệm tiền rõ nhất cho team Việt: job Spark viết bằng Scala thường phải giữ cluster riêng, giờ chỉ trả tiền lúc chạy. Còn Lakebase được duyệt HIPAA, C5, TISAX là tín hiệu cho các doanh nghiệp có dữ liệu nhạy cảm rằng cơ sở dữ liệu OLTP trong lakehouse đã đủ điều kiện đưa vào hệ thống thật. Lời khuyên: đừng đổi kiến trúc vì một feature Beta, nhưng nên dựng một nhánh thử nghiệm CDF trên MV ngay, vì nếu ổn thì nó cắt được cả một tầng bảng trung gian.