Anthropic tinh chỉnh lại bộ classifier an toàn sinh học của Claude Fable 5, cắt khoảng 85% số lần chặn nhầm. Người dùng hỏi về sinh học, sức khỏe và giáo dục thông thường sẽ ít bị đẩy xuống model yếu hơn, trong khi các yêu cầu lưỡng dụng về sinh học chuyên sâu và phát triển thuốc vẫn bị chặn.
💡 Đây là ví dụ hiếm hoi về việc một lab công bố con số cụ thể cho bài toán cân bằng giữa an toàn và tính hữu dụng. False positive quá cao là lý do lớn nhất khiến người dùng bỏ model trong các ngành y tế, giáo dục.
- Classifier sinh học của Fable 5 giảm khoảng 85% false positive.
- Câu hỏi sức khỏe, giáo dục thông thường không còn bị hạ xuống model yếu.
- Yêu cầu lưỡng dụng về sinh học chuyên sâu và phát triển thuốc vẫn bị chặn.
- Cùng tuần Anthropic mở beta quét bảo mật skill và plugin bên thứ ba.
Đây là con số đáng chú ý vì hiếm lab nào dám công bố. False positive trong safety classifier là thứ giết chết trải nghiệm nhanh nhất: người dùng hỏi một câu sinh học phổ thông, model từ chối hoặc bị hạ cấp, và họ bỏ đi luôn. Với các ngành y tế, dược, giáo dục ở Việt Nam, đây từng là rào cản thật khi triển khai. Điểm cần hiểu là Anthropic không nới an toàn mà làm classifier chính xác hơn: ranh giới lưỡng dụng vẫn giữ nguyên. Bài học cho ai đang tự dựng lớp guardrail: đừng chỉ đo tỉ lệ chặn được, phải đo cả tỉ lệ chặn nhầm. Một guardrail chặn 100% nhưng làm hỏng 30% câu hỏi hợp lệ thì thực chất là guardrail hỏng. Nếu bạn đang xây chatbot nội bộ cho bệnh viện hay trường học, hãy lấy đây làm chuẩn để đàm phán yêu cầu với bên bảo mật.