Mùi rugpull quen thuộc. Google vừa phát hành Gemini 3.6 Flash, khoe DeepSWE 49%, MLE 63.9%, giá output giảm 16.7%. Đội ngũ bảo đây là bước tiến về Agent efficiency. Nhưng tôi nhìn vào dòng code benchmark và thấy vết nứt.
Cái bẫy giấu trong dòng code. Họ giảm số bước inference và tool call, cắt token tiêu thụ 17%. Điều này nghe có vẻ tốt: rẻ hơn, nhanh hơn. Nhưng không ai hỏi: sự cắt giảm đó đến từ đâu? Có phải họ đã hy sinh safety guardrail để đẩy nhanh execution? Trong thế giới blockchain, việc tối ưu gas cost bằng cách bỏ qua checksum là recipe cho disaster.
Wash trade không bao giờ là ngẫu nhiên. Tôi đã phân tích 500 hợp đồng thông minh, tôi biết khi nào một dự án tạo khối lượng giả. Ở đây, Google chỉ report positive benchmark mà không công bố kiến trúc chi tiết. DeepSWE 49% có thể là kết quả của overfitting trên dataset SWE-bench, không phải năng lực thực sự. Hãy nhìn vào lịch sử: năm 2020, YAM Finance cũng khoe TVL cao ngất trước khi sập. Cùng một pattern: thiếu minh bạch.
Bối cảnh: thị trường AI đang đi ngang. OpenAI giữ im lặng, Anthropic tập trung safety. Google cần một cú hích để giữ vị thế. Họ chọn chiến thuật "engineering optimization" thay vì kiến trúc mới. Giống như một layer2 khoe TPS cao nhờ sequencer tập trung, không phải ZK proof thực sự.
Core insight: Gemini 3.6 Flash không phải là model mới. Nó là phiên bản distilled của 3.5 với inference path được prune mạnh. Điều này giải thích tại sao input price không đổi (không thay đổi base model) nhưng output price giảm. Họ đã dùng kỹ thuật speculative decoding và chain-of-thought compression. Performance gain trên Agent benchmark là thật, nhưng trên reasoning tổng quát có thể thụt lùi. Tôi sẽ không ngạc nhiên nếu MMLU của nó thấp hơn 3.5 Flash.
Contrarian góc nhìn: Phe bò sẽ nói rằng focus vào Agent là đúng hướng. Thị trường cần model rẻ, nhanh cho tool use, không cần siêu thông minh. Google đang làm điều đó. Và việc họ khởi động pretrain Gemini 4 cho thấy họ vẫn đầu tư dài hạn. Nhưng hãy nhìn vào chi phí: pretrain một model cỡ GPT-4 tốn hàng tỷ đô. Google có đủ can đảm để chịu lỗ nếu thất bại? Trong crypto, những dự án khoe "most ambitious pretraining" thường kết thúc với một cuộc gọi vốn khác.
Takeaway: Đừng mua hype benchmark. Hãy đợi third-party evaluation trên Chatbot Arena. Nếu model thực sự hiệu quả, nó sẽ tự chứng minh qua adoption. Còn nếu không, đây chỉ là một cú pump-and-dump khác trong ngành AI. Google đang chơi trò chơi quen thuộc: tạo noise để che đi sự thiếu đột phá.
Dựa trên kinh nghiệm audit 2017 EOS của tôi, tôi biết khi nào một dự án giấu lỗ hổng trong code. Gemini 3.6 Flash không có gì mới ngoài việc prune inference graph. Và prune luôn đi kèm với nguy cơ mất robustness. Hãy nhìn vào con số: 12% gain DeepSWE nghe có vẻ lớn, nhưng nếu do giảm safety checks thì đó là trade-off không bền vững. Google không công bố HarmBench score. Đó là red flag.
Kết luận: Tôi đặt confidence level B- cho phân tích này. Cần thêm dữ liệu. Nhưng trong bối cảnh thị trường đi ngang, hành động của Google giống một layer2 khoe TVL hơn là một ZK rollup thực thụ. Ai đang kiểm soát pool thanh khoản? Ở đây, ai đang kiểm soát benchmark data? Câu trả lời: chính Google. Và họ có incentive để làm đẹp số. Đừng để bị lừa bởi những con số không có audit độc lập.
Câu chuyện kết thúc: Năm 2021, tôi phát hiện wash trading trên OpenSea. Các dự án tạo khối lượng giả để gây FOMO. Gemini 3.6 Flash cũng vậy. Tôi chỉ ra benchmark có thể đã được "rửa" bằng cách chọn lọc test cases. Đến khi community tự chạy lại, kết quả thường thấp hơn 5-10%. Hãy chuẩn bị tinh thần cho điều đó.
Vậy nên, nếu bạn là builder, đừng vội migrate. Hãy test trên use case thực tế của bạn. Còn nếu bạn là investor, đừng buy rumor. Gemini 4 mới là thứ đáng chờ, nhưng cũng có thể là một bài học đắt giá. Cái bẫy giấu trong dòng code sẽ lộ diện khi bạn đào sâu vào pretraining details. Mà Google chưa cho ai thấy code.