Một báo cáo phân tích gần đây đã chỉ ra rằng các AI agent hiện tại chỉ đạt tỷ lệ thành công dưới 30% khi thực hiện các hướng dẫn phức tạp trong môi trường mô phỏng. Con số này, mặc dù không được công bố chi tiết về điều kiện benchmark, nhưng hoàn toàn phù hợp với các kết quả nghiên cứu công khai trong lĩnh vực trí tuệ nhân tạo. Đối với cộng đồng blockchain, nơi AI agent đang dần được tích hợp vào các giao thức DeFi, DAO và thậm chí cả hệ thống thanh toán, thông tin này mở ra một loạt câu hỏi về độ tin cậy và khả năng triển khai thực tế.
Bối cảnh: AI agent, không giống như chatbot đơn thuần, là các hệ thống tự động có khả năng tương tác nhiều bước, gọi công cụ và thực thi các nhiệm vụ dài hạn. Trên blockchain, chúng được kỳ vọng sẽ thực hiện các tác vụ như tối ưu hóa thanh khoản, quản lý rủi ro tự động, hay thậm chí đại diện cho người dùng trong các cuộc bỏ phiếu DAO. Tuy nhiên, nếu tỷ lệ thành công dưới 30% cho các hướng dẫn phức tạp, thì việc triển khai không giám sát là điều không tưởng.
Phân tích kỹ thuật: Dựa trên kinh nghiệm đánh giá hợp đồng thông minh của tôi trong thời kỳ ICO, tôi nhận thấy sự tương đồng rõ rệt giữa lỗi tích lũy trong multi-step agent và lỗi tràn ngăn xếp trong smart contract. Các nghiên cứu như WebArena (2023-2024) cho thấy GPT-4 level agent chỉ đạt 35% thành công end-to-end; TravelPlanner có tỷ lệ dưới 10% cho các ràng buộc phức tạp; GAIA Level 2/3 thường dưới 30%. Lỗi tích lũy là nguyên nhân chính – giả sử mỗi bước độc lập có tỷ lệ thành công 90%, một nhiệm vụ 12 bước chỉ đạt 0.9^12 ≈ 28%. Ngoài ra, hiện tượng 'lost in the middle' (Liu et al., 2023) khiến các hướng dẫn dài bị bỏ qua một cách có hệ thống. Điều này giải thích tại sao tỷ lệ thành công lại thấp đến vậy.
Tuy nhiên, có một góc nhìn phản trực giác: tỷ lệ thành công end-to-end thấp không đồng nghĩa với giá trị thương mại bằng không. Các bước con thành công một phần có thể vẫn mang lại giá trị, đặc biệt trong các tác vụ như phân tích dữ liệu on-chain hay gợi ý giao dịch. Trong thực tế, các sản phẩm agent hàng đầu hiện nay đều sử dụng human-in-the-loop, tức là con người xác nhận các bước quan trọng. Điều này thay đổi hoàn toàn mô hình kinh tế đơn vị: chi phí giám sát làm giảm lợi ích từ tự động hóa, khiến mô hình 'augmentation' (tăng cường) trở nên thực tế hơn 'replacement' (thay thế).
Takeaway cho cộng đồng blockchain: Nếu bạn đang xây dựng một agent tự động quản lý pool thanh khoản hay thực hiện chiến lược arbitrage, hãy chuẩn bị cho kịch bản thất bại thường xuyên. Cần có cơ chế fallback mạnh mẽ và giám sát thời gian thực. Dựa trên quan sát của tôi trong quá trình nghiên cứu CBDC, các hệ thống thanh toán số đều yêu cầu độ tin cậy trên 99,9%, vì vậy agent với tỷ lệ thành công dưới 30% chỉ nên được triển khai trong các ngữ cảnh rủi ro thấp, có sandbox. Câu hỏi cuối cùng: liệu AI agent có thể vượt qua rào cản lỗi tích lũy để trở thành công dân hạng nhất trên blockchain, hay chúng mãi mãi chỉ là trợ lý cần con người kèm cặp?