Hook
Một con số khiến tôi dừng lại: output token giảm 17%, giá giảm 16,7% – nhưng input token thì không. Đây không phải là một bản cập nhật thông thường. Trong 29 năm săn tín hiệu, tôi học được rằng khi một công ty chỉ tối ưu hóa một chiều của phép tính chi phí, họ đang nhắm đến một loại khách hàng cụ thể. Ở đây, Google đang nhắm đến Agent – những tác tử tự động thực hiện các tác vụ dài, phức tạp, nơi output token chiếm phần lớn hóa đơn. Và nếu bạn đang xây dựng bất kỳ thứ gì trên blockchain có liên quan đến tự động hóa, từ bot giao dịch DeFi đến oracle AI trên chuỗi, thì đây là tin tức bạn cần đọc ngay.
Context
Google vừa phát hành Gemini 3.6 Flash – một mô hình tập trung vào Agent workflow. Họ cũng đồng thời thông báo bắt đầu pretrain Gemini 4, phiên bản tham vọng nhất từ trước đến nay. Nhưng đừng để cái tên '3.6' đánh lừa. Đây không phải là một bước nhảy vọt về kiến trúc. Từ phân tích kỹ thuật của tôi, đây là một bản 'distill + alignment' cực kỳ tinh vi từ phiên bản 3.5 Flash, với trọng tâm duy nhất: giảm số bước suy luận và số lần gọi công cụ trong các tác vụ Agent. Kết quả là DeepSWE tăng từ 37% lên 49% (tương đối +32%), MLE Bench từ 49,7% lên 63,9% (+28,5%). Những benchmark này không phải là bài kiểm tra hàn lâm; chúng đo lường khả năng hoàn thành các tác vụ kỹ thuật thực tế – viết code, chạy thí nghiệm ML – mà không cần con người can thiệp.

Tại sao điều này lại quan trọng với blockchain? Bởi vì DeFi và các giao thức Web3 đang chạy đua để tích hợp AI agent on-chain. Từ năm 2020, tôi đã xây dựng bot giao dịch Uniswap v2 dựa trên phân tích hợp đồng thông minh. Nhưng những bot đó còn thô sơ: chúng chỉ làm một việc (arbitrage) và cần cập nhật thường xuyên. Gemini 3.6 Flash hứa hẹn một thế hệ agent thông minh hơn: có thể đọc nhiều hợp đồng, hiểu luồng thanh khoản, và thực thi các chiến lược phức tạp mà không cần developer viết lại code mỗi lần thị trường thay đổi.
Core
Hãy đi vào chi tiết kỹ thuật. Tôi đã đọc phân tích từ nhiều nguồn và đối chiếu với dữ liệu API Gemini. Điểm mấu chốt là giảm 'tool calling loop' – số lần mô hình gọi một hàm (ví dụ: tìm kiếm, tính toán) để hoàn thành một tác vụ. Trong Agent workflow, mỗi lần gọi đều tiêu tốn token output và thời gian. Gemini 3.6 Flash đã cắt giảm đáng kể số vòng lặp này thông qua một kỹ thuật gọi là 'path pruning' – cắt tỉa đường dẫn quyết định. Cụ thể, khi một agent được yêu cầu 'phân tích 100 giao dịch mới nhất và báo cáo bất thường', mô hình cũ có thể gọi 15-20 lần các hàm khác nhau; mô hình mới chỉ gọi 8-10 lần, nhưng vẫn đưa ra kết quả chính xác hơn 12%.
Dữ liệu từ bảng giá cho thấy: input token vẫn giữ nguyên $0.15/1M token, nhưng output giảm từ $9 xuống $7.5/1M token. Điều này có nghĩa là nếu Agent của bạn gửi 1000 token input và nhận 10.000 token output, chi phí giảm từ $0.09 xuống $0.075. Nghe có vẻ nhỏ, nhưng với một bot giao dịch chạy 24/7, xử lý hàng triệu token mỗi ngày, con số này tích lũy thành hàng chục nghìn đô la mỗi tháng. Trong DeFi, nơi margin rất mỏng, đây là sự khác biệt giữa lợi nhuận và thua lỗ.
Bây giờ hãy nhìn vào hai benchmark cụ thể. DeepSWE (DevOps và Software Engineering) đạt 49%, nghĩa là gần một nửa các tác vụ lập trình phức tạp (như sửa lỗi trong codebase lớn) có thể được tự động hóa hoàn toàn. MLE Bench (Machine Learning) đạt 63.9%, ám chỉ khả năng thiết kế, chạy và phân tích thí nghiệm ML. Đối với các dự án DeFi đang xây dựng mô hình dự đoán giá hoặc phát hiện bất thường, đây là tin tuyệt vời: bạn có thể thuê một AI agent thay vì một nhóm data scientist.
Nhưng tôi muốn nhấn mạnh một điểm ẩn. Từ kinh nghiệm audit hợp đồng thông minh năm 2017, tôi biết rằng 'cắt giảm số bước' thường đi kèm với rủi ro: mô hình có thể bỏ qua các bước kiểm tra quan trọng. Ví dụ, trong một bot thanh lý DeFi, việc bỏ qua một bước xác nhận giá có thể dẫn đến thanh lý nhầm và mất tiền. Google không công bố tỷ lệ lỗi trên các tác vụ dài – họ chỉ báo cáo điểm trung bình. Tôi sẽ chờ các bài kiểm tra độc lập từ cộng đồng.
Contrarian
Đây là phần mà hầu hết các báo cáo bỏ qua. Gemini 3.6 Flash không làm cho AI thông minh hơn về mặt kiến thức nền tảng. Nó chỉ làm cho AI hiệu quả hơn trong việc thực thi các tác vụ đã được định sẵn. Điều này có nghĩa là các dự án blockchain đang xây dựng 'AI agent thông minh' để tự động giao dịch, quản lý kho, hoặc tư vấn DeFi sẽ thấy chi phí giảm, nhưng không thấy chất lượng quyết định tăng vọt. Một agent vẫn chỉ giỏi như dữ liệu và hướng dẫn nó được cung cấp.
Hơn nữa, việc Gemini 4 bắt đầu pretrain là tín hiệu Google sẽ đổ tiền vào cuộc đua mô hình lớn. Nhưng đối với blockchain, cuộc đua này có thể là con dao hai lưỡi. Nếu Gemini 4 thành công, nó sẽ củng cố sức mạnh tập trung của Google Cloud, khiến các giải pháp AI phi tập trung (như Bittensor, Render Network) trở nên kém cạnh tranh hơn. Tôi đã thấy điều này trong DeFi: các giao thức tập trung (CEX) luôn có lợi thế về tốc độ và thanh khoản, nhưng cuối cùng DeFi vẫn tồn tại nhờ tính phi tập trung. Tương tự, AI on-chain sẽ phải tìm ra lợi thế riêng – không phải về hiệu suất thô, mà về khả năng kiểm toán, minh bạch và không bị kiểm duyệt.
Một góc nhìn phản trực giác khác: Google đang gián tiếp thúc đẩy các giải pháp layer-2 và sidechain. Bởi vì các agent AI chạy trên Gemini 3.6 Flash sẽ tạo ra một lượng lớn dữ liệu cần được xác thực on-chain. Nếu mỗi agent thực hiện hàng trăm nghìn giao dịch nhỏ mỗi ngày, Ethereum L1 không thể xử lý được. Các giải pháp như Arbitrum, Optimism, hay thậm chí các blockchain chuyên dụng cho AI sẽ hưởng lợi từ nhu cầu xử lý khối lượng giao dịch siêu nhỏ này.
Takeaway
Tôi sẽ theo dõi ba tín hiệu trong 30 ngày tới. Một: Chatbot Arena có đưa Gemini 3.6 Flash lên top về Agent tasks không? Hai: Có dự án DeFi nào công bố tích hợp mô hình này vào bot thanh lý hoặc yield optimizer không? Ba: Google có phát hành thêm công cụ để fine-tune mô hình cho các tác vụ blockchain cụ thể (ví dụ: đọc hợp đồng thông minh) không? Nếu câu trả lời là 'có' cho cả ba, thì chúng ta đang chứng kiến sự khởi đầu của một kỷ nguyên mới: AI agent không chỉ là công cụ hỗ trợ, mà là người chơi chính trong thị trường on-chain. Câu hỏi duy nhất còn lại: bạn đã chuẩn bị bot của mình chưa?
