quanbi.dev
Minh họa một model open-weight tìm lỗ hổng trong môi trường sandbox.

Tin AITin tức

GLM-5.3 làm thay đổi cuộc chơi cyber ra sao

Quân Bi5 phút đọc

Mình vừa đọc thông báo của Anthropic về GLM-5.3 ngày 29 tháng 9, và anh em làm security nên chú ý tới một thay đổi lớn: một model open-weight đã có thể tự nối nhiều bước để tạo exploit hoạt động. Tài liệu ghi các cách safeguard của model này bị vượt khá dễ trong những bài test mô phỏng.

GLM-5.3 làm được gì

Anthropic phân tích model do Zhipu AI phát triển. Nhóm nghiên cứu chạy model trong môi trường cô lập, nơi mục tiêu chỉ là các hệ thống offline do họ dựng lên cho bài đánh giá.

Claude Mythos Preview đạt 56 trên 410 lần thử ở cùng bài đo, nên kết quả của hai model khá sát nhau.

Một benchmark khác dùng 100 tác vụ được chọn ngẫu nhiên. Model tạo được cú chiếm quyền điều khiển luồng trong 4% lần thử, còn Claude Mythos Preview đạt 6%.

Mình chưa tự chạy các benchmark này. Anh em nên đọc những con số trên như kết quả trong sandbox, chưa phải bằng chứng rằng mọi hệ thống ngoài đời đều dễ bị khai thác.

Model vẫn thường từ chối yêu cầu gây hại khi chạy theo cách mặc định. Điểm đáng lo nằm ở việc người dùng có thể chỉnh open-weight model để giảm mạnh tỷ lệ từ chối.

Tài liệu gọi kỹ thuật này là abliteration. Nhóm nghiên cứu mất khoảng 2.200 GPU giờ và chi phí gần 4.400 đô để tạo bản đã chỉnh, còn bản nhỏ hơn mất khoảng 600 GPU giờ.

Sau khi chỉnh, tỷ lệ từ chối giảm từ trên 90% xuống khoảng 3% và 2% trong hai benchmark đầu tiên. Ở benchmark thứ ba, tỷ lệ này còn 12%.

Nhóm nghiên cứu cũng thử cách vượt safeguard mà không cần chỉnh weight. Một prompt đánh lạc hướng khiến model tiếp tục 64% số lần, cách điền sẵn thinking token đạt 92%, còn bản đã chỉnh đạt 100%.

Mình chỉ đang đọc lại kết quả trong tài liệu, chưa tự kiểm chứng các kỹ thuật này. Anh em đừng biến những con số đó thành hướng dẫn tấn công hệ thống thật.

Quyền truy cập tạo khác biệt

Người dùng có thể tải model xuống và tự chạy. Các model Claude trong phép so sánh có safeguard, hoặc chỉ mở cho nhóm người dùng đã được kiểm duyệt.

CAISI đánh giá đây là open-weight model có năng lực cyber cao nhất từng được phát hành tại thời điểm họ đánh giá. Anthropic dẫn lại rằng model vẫn chậm hơn frontier của Mỹ khoảng bốn tháng theo nhóm benchmark cyber của CAISI.

Năng lực này có hai hướng sử dụng. Defender có thể dùng model để tìm lỗ hổng trong software của chính họ, còn attacker có thể dùng cùng năng lực để tìm và khai thác lỗ hổng trước.

Tài liệu cũng nhắc Project Glasswing, chương trình từng giúp các defender đáng tin cậy tìm hơn 10.000 lỗ hổng trong software quan trọng. Cách phát hành giới hạn cho nhóm bảo mật thêm thời gian sửa lỗi trước khi người xấu tiếp cận model tương tự.

Mình thấy đây là phần anh em làm security cần tách bạch. Một model có thể giúp kiểm tra hệ thống của mình, nhưng quyền tự chạy khiến việc kiểm soát mục tiêu và dữ liệu thành chuyện của người dùng.

Nhiều người trong thread phản đối cách Anthropic trình bày nghiên cứu. Người bình luận minimaxir cho rằng việc phân tích model của đối thủ trực tiếp tạo ra xung đột lợi ích.

Người bình luận prymitive đọc thông điệp này theo hướng chính sách. Theo ý kiến của họ, bài viết có thể trở thành nền cho việc hạn chế model open-weight trên toàn cầu.

Người bình luận 0xbadcafebee cho rằng safeguard khiến Claude vướng khi làm công việc bảo mật. Họ đọc kết quả theo hướng model này vẫn hữu dụng hơn cho một số công việc security.

Người bình luận hiddenvulkcan cũng nói guardrail thường cản trở việc điều tra malware, và họ dùng model open-weight cho loại công việc đó. Havoc thì nghi ngờ bài viết đang tác động tới chính sách để hạn chế cạnh tranh từ model Trung Quốc.

Người bình luận water-drummer lại cho rằng bài viết vô tình quảng bá cho model này. Mình đọc các ý kiến đó như phản ứng của cộng đồng, không xem chúng là kết luận độc lập về năng lực.

Điều còn chưa rõ

Tài liệu chưa nói đầy đủ các lỗ hổng được tìm trong những hệ thống khác sẽ được công bố tới đâu. Nhóm nghiên cứu nói họ đang xem xét các báo cáo và sẽ liên hệ maintainer khi phù hợp.

Các benchmark cũng chưa trả lời hết câu hỏi về hiệu quả ngoài sandbox. Người bình luận teravor cho rằng kết quả phụ thuộc nhiều vào cách chuẩn bị context và hướng dẫn model, nhưng đó vẫn là ý kiến trong thread.

Anh em làm security nên giữ một kết luận thực tế: khi weight có thể được chỉnh để bỏ safeguard, công cụ phòng thủ và công cụ tấn công chỉ còn cách nhau ở mục tiêu, quyền truy cập và người đang cầm nó.

Nguồn tham khảo

  1. GLM-5.3 and the spread of advanced cyber capabilities · anthropic.com · Công bố chính thức · đọc ngày
  2. GLM-5.3 and the spread of advanced cyber capabilities (thảo luận trên Hacker News, 256 điểm, 241 bình luận) · Hacker News · Tin tức · đọc ngày

Kiểm chứng lần cuối với openai/gpt-5.6-luna — Cổng kiểm tra tự động: 28 dẫn chứng dò về nguồn đã lưu

Bài này thế nào?

Chia sẻ

XFacebook

Ảnh đại diện của chủ trang quanbi.dev

Về mình

Quân Bi · Người viết

Xem thêm →

Bình luận (0)

Chưa có bình luận nào. Bạn mở hàng nhé.

Viết bình luận