Một CVE với điểm CVSS 9.3 – đó là con số khiến bất kỳ ai trong ngành bảo mật AI cũng phải giật mình. Nhưng điều đáng sợ hơn không phải điểm số, mà là cách nó phơi bày một lỗ hổng kiến trúc chung của toàn bộ hệ sinh thái Agent AI. Dữ liệu không biết nói dối: ba nền tảng lớn – AWS Bedrock, Google ADK và Vercel SDK – cùng bị ảnh hưởng bởi cùng một căn nguyên: tầng điều phối (orchestration layer) chỉ kiểm tra hình dạng dữ liệu, không kiểm tra nguồn gốc. Đây là một bài toán mà tôi, với vai trò là một on-chain data analyst, đã từng đối mặt trong nhiều hợp đồng thông minh: bề mặt sạch sẽ, bên trong hỗn loạn.

Bối cảnh: CoreBreak là cụm từ do nhóm nghiên cứu Stealth và Adversa AI đặt cho một loạt lỗ hổng ảnh hưởng đến ba hệ thống Agent AI hàng đầu. Ba lỗ hổng này không liên quan đến mô hình ngôn ngữ lớn (LLM) hay prompt injection; chúng nằm ở tầng hạ tầng – nơi các cuộc gọi công cụ được thực thi. Khi một Agent AI nhận lệnh từ người dùng, nó sẽ gọi các công cụ bên ngoài (API, cơ sở dữ liệu, hợp đồng thông minh) thông qua một tầng điều phối. Vấn đề là tầng điều phối này tin tưởng mọi dữ liệu có định dạng đúng là do mô hình sinh ra, mà không xác thực nguồn gốc. Kẻ tấn công có thể trực tiếp gửi các khối nội dung cuộc gọi công cụ giả mạo vào luồng tin nhắn, và Agent sẽ thực thi chúng như thể do chính LLM yêu cầu. Mô hình phòng thủ cấp độ model (system prompt, refusal training) hoàn toàn mù tịt vì chúng không tham gia vào chuỗi thực thi.
Phân tích cốt lõi: Ba CVE được công bố: - CVE-2026-18830 (AWS Bedrock AgentCore): API InvokeHarness cho phép người gọi từ xa đã xác thực chèn trực tiếp các khối tool use vào tin nhắn cuối. Điểm CVSSv4 8.6, mức cao. - CVE-2026-18236 (Google ADK for Python): Kẻ tấn công có thể thao túng lịch sử phiên để giả mạo xác nhận của con người cho các công cụ nhạy cảm. Điểm CVSSv4 9.3, mức nghiêm trọng. - CVE-2026-64650/64651 (Vercel @ai-sdk): Kiểm tra đường dẫn tiến trình bị bypass bởi mã độc trong sandbox Linux. Điểm CVSSv4 6.3. Điểm chung: tất cả đều là "inspection-execution gap" – khoảng cách giữa kiểm tra và thực thi. Tôi đã từng phát hiện lỗ hổng reentrancy trong hợp đồng ICO năm 2017; cơ chế tương tự: hợp đồng kiểm tra số dư nhưng không kiểm tra nguồn gốc lệnh gọi. Ở đây cũng vậy: tầng điều phối kiểm tra định dạng JSON nhưng không kiểm tra xem khối dữ liệu đó có thực sự được sinh ra từ một lượt suy luận hợp lệ của mô hình hay không. Không cần prompt injection, không cần vượt qua alignment – chỉ cần gửi đúng cấu trúc.
Một địa chỉ, hàng ngàn câu chuyện. Mỗi CVE là một câu chuyện riêng, nhưng đều kết thúc bằng cùng một kết luận: tầng điều phối là điểm mù bảo mật. Nghiên cứu GuardFall của Adversa AI còn cho thấy 10/11 AI coding agent bị tấn công shell injection – con số này cho thấy đây không phải lỗi cá biệt mà là vấn đề mang tính hệ thống. Từ góc nhìn on-chain, tôi liên tưởng đến các vụ wash trading NFT mà tôi từng phơi bày: bề mặt khối lượng giao dịch sạch sẽ, nhưng bên trong là mạng lưới ví giả mạo. Ở đây, bề mặt là các cuộc gọi công cụ hợp lệ, nhưng bên trong là các thực thể độc hại.

Góc nhìn phản trực giác: Nhiều người cho rằng mô hình LLM càng mạnh, càng có khả năng chống lại tấn công. Sai. CoreBreak chứng minh rằng mô hình không liên quan đến vấn đề này. Cho dù bạn dùng GPT-6 hay Claude 5, nếu tầng điều phối không xác thực nguồn gốc cuộc gọi công cụ, thì mọi lớp bảo vệ mô hình đều vô hiệu. Đây là một cú sốc đối với cộng đồng AI safety vốn tập trung vào alignment và prompt security. Tôi từng dự đoán sự sụp đổ của FTX bằng cách theo dõi dòng tiền rút bất thường; ở đây, dòng dữ liệu cuộc gọi công cụ cũng cần được theo dõi tương tự. Một điểm mù khác: giả định rằng "xác nhận của con người" là an toàn. CVE-2026-18236 phá vỡ giả định đó: kẻ tấn công có thể giả mạo toàn bộ lịch sử phiên để làm cho Agent tin rằng con người đã duyệt. Tin vào on-chain, không tin vào lời nói – nhưng ở đây, ngay cả "lời nói" của con người cũng có thể bị làm giả.
Takeaway: Tuần tới, hãy theo dõi ba tín hiệu. Thứ nhất, các bản vá: AWS đã tự động triển khai, Google và Vercel yêu cầu người dùng tự cập nhật. Nếu bạn đang vận hành Agent AI, hãy kiểm tra phiên bản ngay. Thứ hai, sự xuất hiện của các công cụ giám sát tầng điều phối – như tôi đã xây dựng dashboard phát hiện bất thường DeFi năm 2020, sẽ có các startup cung cấp giải pháp Agent Runtime Protection. Thứ ba, câu hỏi lớn: liệu MCP (Model Context Protocol) có trở thành tiêu chuẩn cho phép xác thực cuộc gọi công cụ? Nếu không, chúng ta sẽ thấy một làn sóng lỗ hổng tương tự trên toàn bộ hệ sinh thái. Dữ liệu không biết nói dối – nhưng tầng điều phối thì đang nói dối thay cho dữ liệu.