Bạn nghĩ AI viết 80% code production là một bước tiến? Hãy nhìn vào log audit của tôi — mỗi dòng code đều có câu chuyện, và AI đang viết câu chuyện đó mà không có sự đồng thuận của con người.
Anthropic vừa tuyên bố: 80% code sản xuất của họ được Claude viết. Đây là thông tin đến từ một cuộc phỏng vấn với Crypto Briefing, một trang tin thiên về đầu tư crypto, không phải AI. Ngay lập tức, cộng đồng developer xôn xao. Nhưng với tôi — một người đã audit hợp đồng thông minh từ mùa ICO 2017 — tuyên bố này giống như một hợp đồng token thiếu hàm transfer vậy: nghe có vẻ ấn tượng, nhưng khi mổ xẻ thì thấy nhiều lỗ hổng.
Hãy bắt đầu từ cái móc câu: "80% production code". Con số này đến từ đâu? Anthropic không công bố phương pháp đo lường. Là số dòng code? Số pull request? Hay số function được merge? Mỗi cách tính cho một câu chuyện khác nhau. Nếu tính theo dòng, thì test code, config, script CI/CD cũng được tính; nếu chỉ tính business logic, con số sẽ thấp hơn nhiều. Đây chính là điểm mù kỹ thuật đầu tiên.
Nhưng tôi không dừng lại ở đó. Là một Smart Contract Architect, tôi đã chứng kiến hàng trăm dự án DeFi sụp đổ vì một lỗi nhỏ trong code. Hồi tháng 6 năm 2017, tôi dành ba tuần cuối tuần audit hợp đồng ERC-20 của ShibeCoin. Tôi phát hiện lỗi batchTransfer — hàm cho phép gửi token đến mảng địa chỉ mà không kiểm tra msg.value, có thể bị lợi dụng để đúc token giả. Lỗi đó đến từ một developer, không phải AI. Nhưng nếu AI viết code, liệu nó có phát hiện ra edge case tương tự? Có thể không, vì AI học từ dữ liệu huấn luyện — nơi mà những lỗi như vậy tồn tại rất nhiều.

Anthropic đang kể câu chuyện dogfooding: dùng sản phẩm của chính mình để chứng minh chất lượng. Điều này không mới — Microsoft từng làm với Windows, Google với các internal tool. Nhưng trong AI, câu chuyện có một twist: nếu Claude viết 80% code, thì ai review code đó? Chính các kỹ sư Anthropic. Và họ là những người giỏi nhất, hiểu rõ nhất sản phẩm. Nhưng với một startup hay một dự án blockchain, liệu họ có đủ nguồn lực để review 80% code do AI viết? Tôi nghi ngờ.

Phân tích kỹ thuật: Để đạt được 80% code production, hệ thống phải có một pipeline hoàn chỉnh: tạo mã, chạy test, review, CI/CD. Claude không chỉ là một autocomplete, nó là một agent. Nó đọc toàn bộ codebase, hiểu context, viết code, và thậm chí sửa lỗi. Nhưng vấn đề là: AI sinh code là xác suất. Nó có thể tạo ra một hàm trông có vẻ đúng, nhưng sai trong trường hợp biên. Ví dụ: trong Uniswap v2 Router, tôi từng phát hiện một lỗi logic trong hàm swapExactTokensForETH xử lý phí trượt giá ở amountOutMin. Nếu AI viết code đó, nó có thể copy từ một ví dụ khác và bỏ qua validation đầu vào. Kết quả: người dùng mất tiền.
Contrarian angle: Tôi cho rằng 80% code do AI viết thực chất là một rủi ro, không phải thành tựu. Trong blockchain, code là luật. Một lỗi nhỏ có thể dẫn đến mất hàng triệu USD. Hãy nhìn vào vụ hack Arbitrum Nitro bridge năm 2022 — tôi đã tự build môi trường local và reproduce lỗi double-spend trong validateProof. Nếu AI viết code đó, liệu nó có kiểm tra seqNum tăng dần? Có thể không, vì AI không hiểu bối cảnh tài chính. Nó chỉ tối ưu hóa cho việc pass test.
Hơn nữa, việc phụ thuộc vào AI sinh code có thể tạo ra "technical debt" về mặt hiểu biết. Khi developer không còn viết code từ đầu, họ mất khả năng hiểu sâu về logic. Điều này đặc biệt nguy hiểm trong audit: một auditor giỏi phải hiểu từng dòng code, không chỉ xem kết quả. Nếu AI viết 80% code, auditor sẽ phải đọc code do AI viết — một dạng "code alien" khó hiểu hơn code người viết.
Takeaway: Tôi dự đoán rằng trong 12 tháng tới, chúng ta sẽ thấy sự gia tăng các lỗ hổng bảo mật trong các dự án blockchain sử dụng AI để sinh code. Các dự án sẽ cần công cụ audit đặc biệt dành cho AI-generated code, hoặc phải đánh dấu các contract có nguồn gốc từ AI là "high risk". Còn về Anthropic, tôi không phủ nhận thành tựu của họ, nhưng tôi sẽ không bao giờ deploy một smart contract mà 80% code do AI viết nếu không có audit từng dòng. Code không bao giờ nói dối, nhưng AI có thể — bằng cách nói những điều đúng 99% thời gian, để lại 1% gây thiệt hại.