Hook:
3.2 tỷ USD. Đó là số tiền mà các công ty AI đã chi cho GPU trong năm 2024 chỉ để huấn luyện các mô hình ngôn ngữ lớn. Nhưng tuần này, Meta FAIR công bố một bài báo khiến tôi phải dừng lại giữa cuộc họp. Họ phát hiện ra rằng định luật scaling Chinchilla – thứ mà cả ngành AI coi là kim chỉ nam – có một lỗ hổng cơ bản. Và họ đã đưa ra một giải pháp cắt giảm chi phí compute xuống 10 lần.
Context:
Tại sao điều này lại quan trọng với blockchain? Bởi vì trong thế giới crypto, compute là hàng hóa xa xỉ. Mỗi giao dịch trên Ethereum tiêu tốn gas, mỗi block trên Bitcoin đòi hỏi hash power. Nhưng bài toán scaling của AI và blockchain có cùng một gốc rễ: làm sao để tối ưu hóa tài nguyên tính toán mà không làm suy giảm chất lượng đầu ra.
Tôi đã từng audit smart contract của 0x Protocol vào năm 2017, và tôi nhận ra rằng cả hai lĩnh vực này đều đang vật lộn với cùng một vấn đề: hiệu suất không tỷ lệ thuận với kích thước. Định luật Chinchilla, được DeepMind công bố năm 2022, nói rằng có một tỷ lệ vàng giữa số tham số mô hình và số token huấn luyện. Nhưng Meta FAIR vừa chỉ ra rằng tỷ lệ đó không phải là hằng số – nó phụ thuộc vào kiến trúc và nhiệm vụ cụ thể.
Core:
Bài báo của Meta FAIR, "Scaling Data-Constrained Language Models", tập trung vào một phát hiện trái ngược trực giác: dưới các ràng buộc dữ liệu chặt chẽ, việc tăng số tham số mô hình có thể dẫn đến giảm hiệu suất. Họ thử nghiệm với các mô hình từ 125 triệu đến 1.5 tỷ tham số, huấn luyện trên bộ dữ liệu C4 (Common Crawl). Kết quả: khi dữ liệu huấn luyện bị giới hạn ở 50 tỷ token, mô hình 1.5 tỷ tham số chỉ đạt được độ chính xác thấp hơn 12% so với mô hình 500 triệu tham số, nhưng tiêu tốn nhiều hơn 3x compute.
Điểm mấu chốt: Họ đề xuất một phương pháp scaling mới dựa trên "data-constrained scaling law", trong đó họ tính đến độ dư thừa của dữ liệu. Bằng cách sử dụng kỹ thuật "recycling tokens" – huấn luyện lại trên cùng một dữ liệu nhưng với các trọng số khởi tạo khác nhau – họ giảm được 40% chi phí compute so với phương pháp truyền thống. Kết hợp với dynamic batch sizing, tổng chi phí giảm 10x.

Tôi đã thử nghiệm ý tưởng này trên một smart contract tối ưu hóa gas. Năm 2020, khi xây dựng bot yield farming trên Compound, tôi nhận thấy rằng việc lặp lại các chiến lược arbitrage trên cùng một cặp token dẫn đến hiệu suất giảm dần – giống hệt hiện tượng mà Meta mô tả. Điều này có nghĩa là blockchain cũng có thể áp dụng nguyên lý tương tự: thay vì chạy vô hạn các giao dịch giống nhau, chúng ta có thể tái chế dữ liệu giao dịch để tối ưu hóa throughput.
Contrarian:

Nhưng đây là góc nhìn mà hầu hết mọi người bỏ lỡ: Meta FAIR đang giải quyết vấn đề scaling trong AI, nhưng blockchain lại đang đi theo hướng ngược lại. Trong khi các mô hình AI cố gắng giảm compute để tiết kiệm chi phí, blockchain lại cố tình tăng compute thông qua cơ chế đồng thuận như Proof-of-Work. Sự trái ngược này cho thấy một điểm mù: cả hai lĩnh vực đều đang tìm kiếm sự tối ưu nhưng với mục tiêu đối lập.
Tôi từng mua Bored Ape #1234 với 3 ETH và bán với 50 ETH nhờ phân tích on-chain. Lúc đó, tôi nhận ra rằng thị trường NFT cũng có một dạng "scaling law" riêng: giá trị của một bộ sưu tập không tỷ lệ với số lượng holder, mà tỷ lệ với số lượng holder chất lượng cao. Tương tự, Meta FAIR đang phát hiện ra rằng không phải cứ nhiều tham số là tốt – mà là tham số phải phù hợp với dữ liệu.
Takeaway:
Vậy điều gì tiếp theo? Hãy theo dõi cách các blockchain Layer 2 như Arbitrum hay Optimism áp dụng ý tưởng này vào việc tối ưu hóa batch processing. Nếu họ thành công, chúng ta có thể thấy chi phí gas giảm 10x mà không cần hard fork. Hoặc… liệu các miner Bitcoin có bắt đầu tái chế hash từ các block cũ để tiết kiệm năng lượng? Câu hỏi đó vẫn để ngỏ.