Hôm thứ Hai, Alibaba phát hành Qwen3.8-Max, một mô hình ngôn ngữ lớn với 2,4 nghìn tỷ tham số, và ngay lập tức gây chú ý khi xếp thứ tư trên bảng xếp hạng Frontend Code của Arena, chỉ sau Claude Opus 5 và Kimi K3. Điểm số 1.668, một điểm sau Claude Opus 5 (High) và kém hơn Kimi K3 (Max) 8 điểm. Điều gây sốc hơn cả: Alibaba tuyên bố sẽ mở mã nguồn (open weights) cho mô hình này vào tuần tới. Đây là lần đầu tiên một dòng Qwen-Max, vốn được coi là flagship thương mại, xuất hiện dưới dạng mở. Nhưng giữa những con số ấn tượng, cộng đồng kỹ thuật có quyền đặt câu hỏi: sự thật đằng sau những điểm benchmark là gì, và việc mở weights có thực sự biến Qwen trở thành một "anh hùng phi tập trung" như những lời tung hô trên Twitter?
Bối cảnh của sự kiện này không chỉ nằm ở công nghệ, mà còn ở địa chính trị và thị trường. Alibaba đã chứng kiến cổ phiếu tăng 6,15%, lên mức 124,20 đô la Hồng Kông, sau khi công bố các con số benchmark. Đây là phiên tăng thứ hai liên tiếp, sau khi có tin về một thỏa thuận chip với Moonshot, startup AI của Trung Quốc. Nhưng điều thú vị là các nhà đầu tư, ít nhất là trong ngắn hạn, dường như đặt cược vào câu chuyện mã nguồn mở. Họ nhìn thấy một Alibaba đang cố gắng định vị mình giống như một đối thủ của OpenAI, nhưng có điều mà OpenAI không có: sự hậu thuẫn của một gã khổng lồ thương mại điện tử, hạ tầng đám mây lớn thứ ba thế giới, và một hệ sinh thái nghiên cứu đang dồn lực cho AI thế hệ mới.
Tuy nhiên, khi đi sâu vào các bài kiểm tra, bức tranh trở nên phức tạp hơn nhiều so với các con số được Alibaba công bố. Theo dữ liệu họ chia sẻ, Qwen3.8-Max đạt 86,6 điểm trên TerminalBench-2.1, 93,0 trên PaperBench và 86,1 trên OSWorld-Verified. Những bài test này, vốn đòi hỏi khả năng lập trình, sử dụng công cụ và tương tác với môi trường số, cho thấy mô hình này rất mạnh trong các tác vụ tác tử và đa phương thức. Nhưng khi nhìn sang các bài kiểm tra kỹ thuật phần mềm cốt lõi, một khoảng cách hiện ra rõ rệt: trên SWE-Pro, Qwen chỉ đạt 67,7, trong khi Fable 5 của Anthropic đạt 80,0. Trên FrontierSWE, Qwen đạt 73,5, còn Fable 5 là 88,8. Claude Opus 5 còn có phiên bản Max đạt 1.705 điểm trên Arena, một khoảng cách đáng kể. Vậy tại sao một mô hình có 95 tỷ tham số hoạt động, và được tối ưu cho các tác vụ mã hóa, lại lại thất bại ở các bài kiểm tra sửa lỗi thực tế? Câu trả lời có thể nằm ở cách Alibaba huấn luyện mô hình: họ ưu tiên các tác vụ tương tác, tổng hợp thông tin và đa bước, thay vì độ chính xác tuyệt đối của mã nguồn trong môi trường sản xuất. Trong khi Anthropic, với cách tiếp cận an toàn và có kiểm soát, đã xây dựng các mô hình thà ít sáng tạo hơn nhưng đáng tin cậy hơn.
Đối với một nhà làm kỹ thuật như tôi, người đã từng kiểm toán hợp đồng thông minh và chứng kiến sự sụp đổ của FTX, những con số này gợi nhớ đến một bài học quen thuộc: những lời quảng cáo hào nhoáng có thể che giấu những khiếm khuyết cấu trúc. Trong thế giới blockchain, chúng ta đã học được rằng một giao thức có thể đạt hàng nghìn giao dịch mỗi giây trong điều kiện lý tưởng, nhưng lại sụp đổ dưới áp lực thực tế của thị trường. Tương tự, Qwen3.8-Max có thể tỏa sáng trên bảng xếp hạng Frontend Code, nơi mà các tác vụ đánh giá giao diện, HTML/CSS, và các snippet JavaScript, nhưng lại mất điểm ở những bài kiểm tra sửa lỗi phức tạp như SWE-Pro. Điều này không có nghĩa Qwen là một mô hình kém; nó chỉ có nghĩa là Alibaba đang tối ưu hóa cho những mục tiêu khác: chiếm lĩnh thị phần AI tiêu dùng và doanh nghiệp, thông qua các chatbot và các tác tử trợ lý, thay vì cạnh tranh với các kỹ sư phần mềm cấp cao.
Điều thú vị nhất, và cũng là điều khiến bài viết này có một góc nhìn khác biệt, là việc Alibaba công bố sẽ mở weights của Qwen3.8-Max và Qwen3.8-27B. Động thái này ngay lập tức được cộng đồng AI nguồn mở đón nhận như một chiến thắng lịch sử. Nhưng hãy là một người theo chủ nghĩa hoài nghi lành mạnh, như tôi đã học được sau thảm họa ICO năm 2017. Khi một tập đoàn khổng lồ tuyên bố mở mã nguồn, chúng ta cần hỏi: họ đang thực sự phi tập trung hóa quyền lực, hay họ đang dùng mã nguồn mở như một vũ khí chiến lược để chống lại các đối thủ phương Tây? Lịch sử đã cho thấy, nhiều công ty mở mã nguồn chỉ để hạ thấp rào cản gia nhập của đối thủ, trong khi vẫn kiểm soát phần lớn hạ tầng đám mây, dữ liệu huấn luyện, và các dịch vụ thương mại đắt giá. Alibaba có thể mở weights, nhưng họ vẫn kiểm soát GPU, hệ thống phân phối, và các API thương mại. Hơn nữa, việc mở weights không đồng nghĩa với việc mở dữ liệu huấn luyện, mở mã nguồn cho toàn bộ quy trình huấn luyện, hay mở các tài liệu kỹ thuật đầy đủ. Trong khi đó, các mô hình như Llama của Meta đã được mở từ lâu, nhưng điều đó có giúp cộng đồng blockchain và AI phi tập trung trở nên độc lập hơn không? Rõ ràng là không, bởi vì năng lực tính toán vẫn nằm trong tay một số ít tập đoàn.
Đây là lúc mà góc nhìn phản trực giác của tôi trở nên quan trọng. Thị trường AI gần đây đang rất hưng phấn với những mô hình mã nguồn mở từ Trung Quốc, đặc biệt là sau sự xuất hiện của DeepSeek. Nhưng tôi tin rằng, việc mở weights của Qwen3.8-Max không phải là một hành động từ bi, mà là một bước đi chiến lược trong cuộc chiến chip và AI giữa Mỹ và Trung Quốc. Khi Mỹ siết chặt xuất khẩu chip, các công ty Trung Quốc buộc phải tối ưu hóa mô hình để chạy trên phần cứng kém hơn, và mở mã nguồn là một cách để tạo ra một hệ sinh thái có thể phát triển độc lập, và có thể thu hút các nhà phát triển toàn cầu, từ đó tăng cường ảnh hưởng của Trung Quốc trong cuộc đua AI. Điều này giống hệt như cách mà các dự án blockchain vào năm 2020 đã dùng token để bootstrap cộng đồng, trước khi chính họ trở thành những kẻ tập trung quyền lực mới. Liệu chúng ta có đang chứng kiến một sự lặp lại của lịch sử, khi mà các tập đoàn lớn sử dụng tư duy "phi tập trung" như một cái vỏ bọc cho mục tiêu thống trị thị trường?
Tuy nhiên, cần công bằng mà nói, việc mở weights vẫn là một bước tiến lớn. Với một mô hình có 95 tỷ tham số hoạt động, và một cửa sổ ngữ cảnh lên đến một triệu token, cộng đồng AI nguồn mở sẽ có cơ hội nghiên cứu sâu hơn về kiến trúc mô hình, khả năng suy luận, và giới hạn của nó. Điều này có thể thúc đẩy sự đổi mới ở các lĩnh vực ngoài biên giới nước Mỹ, và tạo ra một làn sóng các công cụ AI phi tập trung mới, giống như cách mà Bitcoin và Ethereum tạo ra một hệ sinh thái tiền tệ phi tập trung. Tôi đã thấy những thí nghiệm đầu tiên về việc sử dụng các mô hình này để tạo ra các hợp đồng thông minh an toàn hơn, hoặc để kiểm tra mã Solidity, và đó là một hướng đi đầy hứa hẹn. Nhưng chúng ta phải nhớ rằng, chỉ riêng weights là chưa đủ, giống như chỉ có một blockchain là không đủ để tạo ra một nền kinh tế phi tập trung. Cần có dữ liệu, cần có công cụ huấn luyện, cần có các dịch vụ tính toán phi tập trung, và cần có những người dùng sở hữu dữ liệu của chính họ. Alibaba có thể đã mở một cánh cửa, nhưng con đường đến một AI thực sự phi tập trung vẫn còn rất dài.
Một điểm mù khác trong câu chuyện này là các bài kiểm tra benchmark. Arena là một bảng xếp hạng do cộng đồng bình chọn dựa trên các trận đấu Elo, nhưng nó có thể bị thao túng bởi các chiến lược tiếp thị, hoặc bởi chính các nhà phát triển tối ưu hóa mô hình của họ để đánh lừa người dùng trong một số tác vụ cụ thể. Trong khi đó, các bài kiểm tra như SWE-Pro và FrontierSWE là các bài kiểm tra có cấu trúc, đòi hỏi mô hình phải thực sự hiểu mã nguồn, tìm và sửa lỗi. Ở đây, Qwen không chỉ thua Fable 5, mà còn có thể thua cả các mô hình mã nguồn mở khác như Llama 4. Sự khác biệt này cho thấy một xu hướng: các mô hình Trung Quốc, với nguồn lực có hạn, thường tập trung vào các tác vụ mà cộng đồng người dùng quan tâm nhất, như viết code nhanh, tạo giao diện, hoặc trò chuyện đa phương thức. Trong khi đó, các mô hình phương Tây mạnh hơn ở các tác vụ đòi hỏi độ tin cậy cao, vốn là nền tảng cho các ứng dụng doanh nghiệp và an toàn. Và nếu chúng ta nói về ứng dụng trong blockchain, dù là tạo ra các hợp đồng thông minh, kiểm toán bảo mật, hay phân tích dữ liệu on-chain, độ tin cậy là yếu tố quyết định, chứ không phải là tốc độ tạo mã.
Vậy, Qwen3.8-Max có phải là một mối đe dọa thực sự đối với các gã khổng lồ Mỹ? Câu trả lời, như nhiều vấn đề trong cuộc sống, là có, nhưng ở một phạm vi nhất định. Alibaba đã chứng minh rằng họ có thể tạo ra một mô hình cạnh tranh tốt trong một số tác vụ cụ thể, và chiến lược mở mã nguồn của họ có thể sẽ định hình lại cấu trúc của ngành công nghiệp AI. Nhưng để thực sự vượt qua Claude hoặc GPT-5 trong các bài kiểm tra kỹ thuật cao cấp, họ cần thêm thời gian, thêm dữ liệu, và thêm phần cứng. Sẽ là một sai lầm nếu coi điểm số Arena như một thước đo thực sự của sức mạnh AI. Trong những ngày tới, khi weights được phát hành, chúng ta sẽ có thể tự mình kiểm chứng các tuyên bố đó bằng cách chạy các thí nghiệm độc lập. Tôi dự định sẽ chạy thử nghiệm của riêng mình trên một môi trường sandbox, để xem mô hình này xử lý các bài toán về tính phi tập trung, chữ ký số, và các giao thức đồng thuận như thế nào. Điều này sẽ là một cột mốc quan trọng, bởi vì nó sẽ tạo ra một tiền lệ cho các mô hình AI khác: khi một thị trường có sự cạnh tranh thực sự, và khi mã nguồn được mở ra, công chúng sẽ có quyền kiểm chứng, và sẽ không còn phải tin vào lời quảng cáo của các công ty nữa. Cuộc đua AI này không chỉ là cuộc đua giữa Mỹ và Trung Quốc, mà còn là cuộc đua giữa sự minh bạch và sự tối tăm, giữa sự phi tập trung và sự kiểm soát tập trung.
Hãy tưởng tượng một tương lai năm năm sau, khi một mô hình AI nguồn mở có thể tự động khai thác các cơ hội đầu tư trong DeFi một cách an toàn, hoặc khi một AI được đào tạo trên dữ liệu của cộng đồng, và được sở hữu bởi chính cộng đồng thông qua một DAO. Điều đó nghe có vẻ xa vời, nhưng với sự xuất hiện của Qwen3.8-Max mở weights, cánh cửa đã bắt đầu hé mở. Tuy nhiên, con đường không trải hoa hồng, bởi vì sức mạnh tính toán vẫn còn nằm trong tay một số ít trung tâm dữ liệu. Nếu chúng ta thực sự muốn một AI phi tập trung, chúng ta cần xây dựng một hạ tầng tính toán phi tập trung, giống như cách chúng ta đã xây dựng các giao thức thanh toán phi tập trung. Và điều này liên quan trực tiếp đến blockchain: các mạng lưới tính toán như Render, hoặc các giao thức huấn luyện mô hình phi tập trung, có thể sẽ trở thành những mảnh ghép quan trọng. Nếu Alibaba mở weights, nhưng vẫn giữ độc quyền về GPU và dữ liệu, thì ngay cả khi chúng ta chạy mô hình trên máy tính của mình, chúng ta vẫn phụ thuộc vào kiến trúc của họ. Vậy nên, câu hỏi cuối cùng không phải là Qwen có tốt hay không, mà là liệu sự mở khóa này có dẫn đến một sự phân quyền thực sự, hay chỉ là một cách để chúng ta thay đổi một ông chủ này lấy một ông chủ khác. Hãy chuẩn bị cho một cuộc chơi mới, nơi mà mã nguồn mở không phải là đích đến, mà chỉ là điểm khởi đầu cho một cuộc cách mạng thực sự: cuộc cách mạng về quyền sở hữu dữ liệu, quyền sở hữu các mô hình, và quyền được tham gia vào quá trình ra quyết định về cách mà AI sẽ được sử dụng. Liệu chúng ta có đủ dũng cảm để tiếp tục cuộc hành trình này, hay chúng ta sẽ lại để cho những gã khổng lồ công nghệ định đoạt tương lai của chúng ta? Hãy nhìn vào những gì đang diễn ra với blockchain, và rồi tự rút ra bài học, trước khi quá muộn.

