Kể từ năm 2017, khi tôi lùng sục các ICO để tìm kiếm khối lượng giao dịch giả, tôi đã học được một điều: dữ liệu thô bao giờ cũng kể một câu chuyện chính xác hơn bất kỳ thông cáo báo chí hào nhoáng nào. Thông báo hôm qua của Google về việc phát hành Gemini 3.6 Flash và bắt đầu đào tạo trước cho Gemini 4 cũng không ngoại lệ. Hãy cùng phân tích lớp vỏ bọc tiếp thị và xem chúng ta thực sự có gì."
"## Hook: Một thông số bất thường"
"Tuần này, Google đã công bố một mô hình mới, Gemini 3.6 Flash, đồng thời tuyên bố đã bắt đầu 'nỗ lực đào tạo trước đầy tham vọng nhất' cho Gemini 4. Hãy nhìn vào con số đầu tiên: Giá đầu ra đã giảm 16,7%, từ $9 xuống còn $7,5 cho mỗi triệu token. Nhưng giá đầu vào không thay đổi. Đây không phải là một đợt giảm giá vô điều kiện; đó là một tín hiệu có chủ đích, được tính toán để nhắm vào các tác vụ tốn nhiều đầu ra như lập trình và tác nhân AI, nơi khối lượng token đầu ra thường vượt xa đầu vào."
"## Context: Phương pháp luận dữ liệu của tôi"
"Tôi đã xây dựng sự nghiệp của mình dựa trên việc kiểm tra dữ liệu on-chain và thông số kỹ thuật của mô hình AI. Khi Google phát hành Gemini 3.6 Flash, tôi không chỉ đọc thông cáo báo chí. Tôi lập tức so sánh các điểm chuẩn của nó với các mô hình tiền nhiệm và đối thủ cạnh tranh. Lĩnh vực trọng tâm của tôi là lớp 2 và stablecoin, nhưng khi một gã khổng lồ như Google tung ra một mô hình được tối ưu hóa cho các tác nhân, nó sẽ gửi một tín hiệu đến toàn bộ hệ sinh thái blockchain – nơi mà các tác nhân on-chain đang trở nên phổ biến. Dưới đây là những gì dữ liệu thực sự nói với tôi."
"## Core: Chuỗi bằng chứng trên chuỗi (và điểm chuẩn AI)"
"Hãy bắt đầu với các điểm chuẩn. Google tuyên bố Gemini 3.6 Flash đạt được 49% trên DeepSWE (tăng từ 37%) và 63,9% trên MLE Bench (tăng từ 49,7%). Đây là những mức tăng ấn tượng, khoảng 12 đến 14 điểm phần trăm. Nhưng hãy hỏi: những điểm chuẩn này đo lường điều gì? Chúng đo lường hiệu suất trong các tác vụ tác nhân: lập trình phần mềm và học máy. Đây là những lĩnh vực mà AI có thể tự động hóa khối lượng công việc đáng kể. Các mô hình trước đây của Google, như Gemini 3.5 Flash, đã thể hiện tốt, nhưng sự cải thiện này cho thấy một bước nhảy vọt về chất."
"Nó tiết kiệm hơn bao nhiêu? Họ tuyên bố giảm 17% lượng token đầu ra được sử dụng. Kết hợp với mức giảm giá 16,7%, chi phí hiệu quả tổng thể cho các tác vụ dài có thể giảm khoảng 31%. Đây không phải là một sự đổi mới về kiến trúc; đó là một sự tối ưu hóa kỹ thuật. Google đang sử dụng các kỹ thuật như chưng cất hoặc lấy mẫu suy luận để rút ngắn các bước suy luận và giảm chi phí gọi công cụ. Họ đang cắt giảm các bước không cần thiết trong vòng lặp tác nhân. Hãy nghĩ về điều này giống như việc tối ưu hóa các cuộc gọi hợp đồng thông minh: loại bỏ các bước dư thừa để giảm phí gas."
"Cửa sổ ngữ cảnh 1 triệu token được duy trì. Điều này quan trọng đối với các tác vụ dài hạn, như phân tích toàn bộ cơ sở mã hoặc lịch sử giao dịch. Nhưng lưu ý: cửa sổ ngữ cảnh 1 triệu token không phải là mới. Gemini 2.5 Pro đã có nó. Việc duy trì nó trong một mô hình Flash cho thấy Google đang cố gắng cung cấp khả năng này với chi phí thấp hơn."
"Vậy, Gemini 4 thì sao? Họ nói rằng đây là 'nỗ lực đào tạo trước đầy tham vọng nhất' của họ. Điều này có nghĩa là một mô hình quy mô nghìn tỷ tham số, có khả năng cạnh tranh với GPT-5 và Claude 4. Chi phí? Có thể hơn 1 tỷ đô la. Nguồn lực? Hàng trăm nghìn chip TPU. Rủi ro? Cao. Nếu Gemini 4 thất bại trong việc hội tụ hoặc không đạt được hiệu suất như mong đợi, đó sẽ là một đòn giáng lớn. Hãy theo dõi các checkpoint trung gian và sự ra đi của các nhà nghiên cứu chủ chốt."
"## Góc nhìn đối lập: Mối tương quan không phải là quan hệ nhân quả"
"Có một điểm mù ở đây. Google tuyên bố những cải tiến này là nhờ 'tối ưu hóa kỹ thuật', nhưng họ không xuất bản một báo cáo kỹ thuật chi tiết. Họ cũng không đưa ra so sánh trực tiếp với GPT-4o của OpenAI hoặc Claude 3.5 Sonnet của Anthropic trên các điểm chuẩn giống hệt nhau. Là một nhà thám hiểm dữ liệu, một điểm chuẩn độc lập có giá trị hơn một lời tuyên bố. Chúng ta cần xem xếp hạng Elo của Chatbot Arena để biết vị trí thực sự của mô hình này."
"Một góc nhìn khác: những cải tiến này có thể đi kèm với một sự đánh đổi. Giảm các bước suy luận có thể làm giảm độ chính xác trong các tác vụ phức tạp, nhiều bước. Họ chỉ báo cáo những cải tiến; họ không báo cáo những thất bại cục bộ. Hãy nhớ đến Luna. Bảng điều khiển của tôi cho thấy nó đang mất neo, nhưng tôi đã phải đào sâu vào dữ liệu để hiểu tại sao. Các nhà phát triển cần kiểm tra mô hình này trong các tình huống thực tế trước khi cam kết."
"## Tổng kết: Tín hiệu cho tuần tới"
"Đây là một sự củng cố chiến thuật, không phải một bước đột phá mang tính thế hệ. Google đang tối ưu hóa các mô hình hiện có của mình để cạnh tranh về chi phí và hiệu suất tác nhân. Điều này tốt cho các nhà phát triển: chi phí thấp hơn, hiệu suất cao hơn. Nhưng câu chuyện thực sự là Gemini 4 và liệu nó có thể đưa Google trở lại vị trí dẫn đầu hay không. Hãy theo dõi ba tín hiệu trong tuần tới: (1) điểm Chatbot Arena cho Gemini 3.6 Flash, (2) bất kỳ báo cáo kỹ thuật nào, và (3) tin tức về việc tuyển dụng hoặc ra đi tại DeepMind. Nếu bảng điều khiển của tôi về tài trợ AI cho thấy chi tiêu tăng vọt, tôi sẽ chia sẻ nó. Còn bây giờ, hãy tiếp tục khai thác dữ liệu.