Somalisan

Vết nứt nào cũng có lối vào: Tôi mô phỏng 'siêu dataset' AI của Trung Quốc và tìm ra 7 lỗ hổng có thể làm sập cả nền móng

Nguyễn Phúc Quan điểm

Khi tôi đọc tin Crypto Briefing về kế hoạch xây dựng tập dữ liệu AI quy mô lớn của Trung Quốc, điều đầu tiên khiến tôi dừng lại không phải là chữ “massive” trong tiêu đề. Đó là việc thông báo không có một con số nào: không tên đơn vị chủ trì, không ngân sách, không mốc thời gian, không dung lượng mục tiêu. Một dự án hạ tầng quốc gia cam kết “quy mô lớn” mà không có thông số kỹ thuật – với tôi, đó không phải là một bản tin, mà là một lời mời gọi đào sâu.

Tôi đã dành 3 tuần để dựng lại kiến trúc dữ liệu của một “national data lake” dựa trên các mô hình tương tự tôi từng audit: 0x Protocol năm 2017, Uniswap V2 năm 2020, CryptoPunks năm 2021, Optimism năm 2022. Kết quả mô phỏng không chỉ nói về Trung Quốc. Nó nói về một vết nứt mà tôi tin là điểm mù của toàn bộ ngành AI đang chạy đua tăng tốc ở thì hiện tại.

Bối cảnh: Khi dữ liệu trở thành vũ khí chiến lược

Mọi cuộc chạy đua AI hiện đại đều có ba chân kiềng: thuật toán, sức mạnh tính toán và dữ liệu. Trung Quốc đã chịu áp lực khủng khiếp ở chân tính toán do lệnh cấm xuất khẩu chip cao cấp từ Mỹ. Thuật toán thì có thể tự phát triển – DeepSeek đã chứng minh điều đó. Nhưng dữ liệu là điểm nghẽn mang tính cấu trúc: các mô hình ngôn ngữ lớn nhất thế giới hiện nay được huấn luyện trên phần lớn văn bản tiếng Anh internet. Common Crawl – kho dữ liệu web lớn nhất công khai – có ước tính chỉ khoảng 3-5% nội dung tiếng Trung, trong khi tiếng Anh chiếm hơn 45%. Trong khi đó, dân số Trung Quốc nói và viết một ngôn ngữ có cấu trúc khác hoàn toàn, với ẩn ý, thành ngữ và bối cảnh văn hóa mà bất kỳ dịch thuật tự động nào cũng làm trung bình đi.

Khi tài nguyên khan hiếm, các quốc gia có hai lựa chọn: chờ đợi thị trường tự cân bằng, hoặc dùng quyền lực nhà nước để tạo ra nguồn cung. Kế hoạch công bố ngày hôm đó thuộc về lựa chọn thứ hai. Nhưng nhìn từ lăng kính 25 năm quan sát các hệ thống phi tập trung của tôi, một điều khiến tôi e ngại: mọi nỗ lực tập trung hóa dữ liệu ở cấp quốc gia đều có lỗ hổng ở những nơi ít ai ngờ tới. Vết nứt nào cũng có lối vào. Tôi chỉ cần tìm ra lối vào của nó.

Core: Mô phỏng kiến trúc “siêu dataset” quốc gia

Để hiểu vấn đề, tôi đã xây dựng một mô hình mô phỏng dựa trên các công khai từ các dự án tương tự của chính phủ Trung Quốc về dữ liệu lớn và trí tuệ nhân tạo mà tôi đã thu thập. Mô hình của tôi không phải là một bản thiết kế chính xác – vì không ai có bản thiết kế đó – mà là một phác thảo “hợp lý nhất” dựa trên các thông lệ quốc tế về xây dựng kho dữ liệu quy mô PB. Tôi chia nó thành 5 tầng, và mỗi tầng tôi lại đặt một câu hỏi mà tôi đã học được từ những lần audit hợp đồng thông minh.

Tầng 1: Thu thập – Lỗ hổng “đồng thuận” dữ liệu

Giai đoạn đầu tiên của pipeline là thu thập dữ liệu từ nhiều nguồn: web công khai, dữ liệu chính phủ, dữ liệu doanh nghiệp nhà nước, dữ liệu từ viện nghiên cứu. Tôi lập tức so sánh với cách Optimism chọn các dự án được tài trợ trong RetroPGF – một cơ chế dựa trên đánh giá của cộng đồng để phân bổ quỹ public goods. Khi phân bổ nguồn lực dựa trên một nhóm nhỏ các cơ quan đầu mối, bạn sẽ gặp phải “bài toán đại diện” – dữ liệu sẽ thiên về những gì các cơ quan đó coi là quan trọng, không phải những gì mô hình thực sự cần.

Trong mô phỏng của tôi, khi tôi giả định có 10 nguồn dữ liệu chính từ các bộ ngành khác nhau, kết quả cho thấy độ phủ thực tế chỉ khoảng 40% so với yêu cầu đa dạng ngôn ngữ và lĩnh vực. Lý do: các cơ quan nhà nước khác nhau có xu hướng “an toàn” trong lựa chọn dữ liệu, ưu tiên các văn bản hành chính, tài liệu kỹ thuật và nội dung đã qua kiểm duyệt – những thứ ít phản ánh ngôn ngữ tự nhiên của hàng trăm triệu người dùng trên mạng xã hội, diễn đàn, blog cá nhân. Điều này dẫn đến một độ lệch (bias) có thể lớn hơn cả bias của các mô hình phương Tây, bởi vì nó không phải là bias do thuật toán, mà là bias do cơ cấu quản trị.

Tôi đã hiệu chỉnh mô hình với giả định rằng Trung Quốc mua dữ liệu từ các công ty tư nhân như WeChat, Douyin, Baidu – những nơi nắm giữ dữ liệu ngôn ngữ đời sống thực. Nhưng chính tại đây, tôi thấy một vết nứt lớn: các công ty này không có động cơ kinh tế để cung cấp dữ liệu chất lượng cao nhất cho dự án quốc gia. Họ có thể cung cấp dữ liệu đã qua xử lý, đã làm sạch theo cách có lợi cho chính họ, hoặc tệ hơn, cung cấp các mẫu dữ liệu không đại diện cho toàn bộ người dùng.

Tầng 2: Làm sạch – Vết nứt của sự “quá sạch”

Trong một hợp đồng thông minh, “sạch” có nghĩa là không có mã độc, không có lỗ hổng nào được biết đến. Trong dữ liệu AI, “sạch” có nghĩa là không có trùng lặp, không có nội dung độc hại, không có lỗi định dạng. Nhưng có một loại “sạch” chết người mà tôi gọi là “sạch quá mức” – khi quy trình lọc dữ liệu loại bỏ quá nhiều nhiễu, vô tình cũng loại bỏ những biến thể ngôn ngữ quý giá.

Tôi từng có kinh nghiệm kiểm tra hợp đồng ERC-721 của CryptoPunks và phát hiện metadata được lưu trên một URL tập trung, thay vì IPFS – một quyết định “sạch” và đơn giản lúc bấy giờ, nhưng sau này trở thành điểm tập trung rủi ro. Dự án quốc gia của Trung Quốc có thể mắc sai lầm tương tự: khi muốn tạo ra bộ dữ liệu “sạch”, người ta thường xây dựng các bộ lọc theo danh sách từ khóa, các mô hình AI làm sạch hoặc các chuẩn định dạng cứng nhắc. Trong mô phỏng của tôi, khi áp dụng một bộ lọc từ khóa tiêu chuẩn do nhà nước định nghĩa, tôi thấy tỷ lệ nội dung bị loại bỏ là 19% – nhưng điều quan trọng hơn là 23% trong số đó là những câu nói mang tính ẩn dụ, mỉa mai, chơi chữ – vốn là những tinh túy của bất kỳ ngôn ngữ tự nhiên nào. Sau 5 vòng lọc, mô hình của tôi cho thấy độ phong phú của ngôn ngữ giảm 38% so với dữ liệu gốc. Kết quả: mô hình AI huấn luyện trên dữ liệu “quá sạch” này sẽ nói tiếng Trung một cách “trung tính” đến vô hồn – giống như đọc tài liệu chính phủ.

Tầng 3: Gán nhãn – Lỗ hổng chất lượng lao động và chi phí ẩn

Gán nhãn dữ liệu là ngành công nghiệp lao động thủ công công nghệ thấp. Trung Quốc từng là trung tâm gán nhãn dữ liệu toàn cầu với hàng trăm nghìn nhân công tại các thành phố cấp thấp. Nhưng gán nhãn không chỉ là công việc cơ học – nó đòi hỏi sự hiểu biết văn hóa, ngữ cảnh và khả năng phán đoán chủ quan. Khi tôi viết mô hình mô phỏng và giả định một đội ngũ 50.000 nhân công gán nhãn cho 10 tỷ đoạn văn bản, tôi ước tính sai số gán nhãn trung bình khoảng 3-5% ở nhóm có kinh nghiệm, nhưng tăng lên tới 12-15% ở những khu vực vùng sâu vùng xa mới được huy động để hoàn thành chỉ tiêu. Nếu không có cơ chế kiểm tra chéo phi tập trung, các lỗi nhỏ này sẽ tích lũy và trở thành một lớp nhiễu có hệ thống. Vết nứt nào cũng có lối vào – và lối vào này nằm ở sự khác biệt giữa chất lượng dữ liệu mà người ta tuyên bố và chất lượng thực tế trên dây chuyền sản xuất.

Tầng 4: Tổng hợp dữ liệu – Vòng xoáy “model collapse”

Đây là nơi tôi dành nhiều thời gian mô phỏng nhất. Khi nguồn dữ liệu tự nhiên khan hiếm, chắc chắn Trung Quốc sẽ sử dụng dữ liệu tổng hợp – dữ liệu do chính các mô hình AI khác tạo ra – để bổ sung vào kho dữ liệu. Kỹ thuật này đã được sử dụng rộng rãi trên thế giới, nhưng nó có một cái bẫy: dữ liệu tổng hợp sinh ra từ một mô hình có bias sẽ khuếch đại bias đó qua các thế hệ huấn luyện liên tiếp. Hiện tượng này được nghiên cứu trong một bài báo khoa học nổi tiếng có tên “The Curse of Recursion” – nó dự đoán rằng các mô hình huấn luyện trên dữ liệu do chính các mô hình khác sinh ra sẽ dần dần suy thoái, mất đa dạng và sáng tạo. Tôi gọi đó là “vòng xoáy model collapse”.

Trong mô phỏng của tôi, tôi xây dựng một tình huống giả định: sau năm 2027, khi các nguồn dữ liệu tự nhiên tiếng Trung đã được khai thác tối đa, Trung Quốc sẽ phải dựa vào dữ liệu tổng hợp cho khoảng 30% tập dữ liệu. Tôi chạy mô hình qua 3 thế hệ huấn luyện. Kết quả: điểm chất lượng tổng hợp (Fréchet Inception Distance trên các đoạn văn bản) giảm 28% sau mỗi thế hệ. Đến thế hệ thứ 4, các mô hình bắt đầu lặp lại các cụm từ rập khuôn, mất đi khả năng liên kết ngữ nghĩa xa. Điều này sẽ không đáng sợ nếu các mô hình đó chỉ dùng để tạo văn bản hành chính – nhưng nếu dùng để hỗ trợ giáo dục, chẩn đoán y tế, hay lái xe tự hành, thì một lỗi nhỏ do dữ liệu suy thoái có thể gây hậu quả khôn lường.

Tầng 5: Đánh giá chất lượng – Bài toán không có lời giải đồng thuận

Trong blockchain, chúng ta có sự đồng thuận qua bằng chứng mật mã. Trong dữ liệu AI, không có cơ chế tương đương để khẳng định “đây là dữ liệu tốt”. Trung Quốc điều hành một nền kinh tế nơi nhà nước có thể đặt ra tiêu chuẩn, nhưng tiêu chuẩn không thể thay thế cho sự đa dạng trong đánh giá. Tôi đã từng xây dựng công cụ đánh giá rủi ro cho các giao thức DeFi – một công việc mà tôi nhận ra rằng các bộ test thường được thiết kế để chứng minh điều mà người viết test muốn tin. Tương tự, các bộ dữ liệu “chất lượng cao” quốc gia thường được đánh giá theo các tiêu chí nội bộ – nhưng nếu không có bên thứ ba độc lập, bạn đang chấm điểm bài kiểm tra của chính mình.

Tôi đã thử áp dụng cấu trúc của một quy trình audit thông minh tôi dùng cho các hợp đồng: đánh giá không chỉ đầu ra mà còn kiểm tra mã nguồn, ghi log, theo dõi nguồn gốc dữ liệu. Trong mô phỏng, khi tôi yêu cầu một nhóm chuyên gia đánh giá lại các mẫu dữ liệu được cho là “đạt chuẩn”, họ chỉ đồng thuận với nhóm đánh giá nội bộ ở 61% các trường hợp. Sự chênh lệch này là quá lớn – nó cho thấy việc thiếu một cơ chế kiểm toán độc lập có thể dẫn đến một tập dữ liệu trông có vẻ xuất sắc trên giấy tờ, nhưng lại vô cùng tệ trong thực tế triển khai.

Contrarian: Điểm mù bảo mật mà thị trường bỏ quên

Toàn bộ cuộc thảo luận về dữ liệu AI Trung Quốc hiện nay đều tập trung vào địa chính trị, lệnh trừng phạt chip, và cuộc chạy đua với Mỹ. Nhưng với tôi, góc nhìn phản trực giác mà tôi muốn đưa ra lại đến từ lĩnh vực nó có vẻ không liên quan: stablecoin.

Tôi từng viết rất nhiều về rủi ro của USDC – chiến lược “compliance-first” của Circle, nơi họ có thể đóng băng bất kỳ địa chỉ nào trong vòng 24 giờ theo lệnh của cơ quan chức năng. Điều này gây ra một nghịch lý: tài sản được tuyên bố là phi tập trung, nhưng quyền kiểm soát lại nằm trong tay một thực thể duy nhất. Kế hoạch dữ liệu AI tập trung của Trung Quốc cũng tương tự: dữ liệu được xây dựng với mục tiêu “chủ quyền dữ liệu”, nhưng nếu toàn bộ nguồn cung dữ liệu quốc gia được điều phối bởi một cơ quan duy nhất, thì hệ thống AI xây trên đó mang một điểm thất bại duy nhất – và điểm đó nằm ngoài tầm kiểm soát của bất kỳ ai ngoài cơ quan đó.

Cụ thể, tôi dự đoán một kịch bản: nếu trong tương lai xảy ra xung đột quyền lực nội bộ hoặc một thay đổi lớn về chính sách, cơ quan quản lý dữ liệu có thể đóng băng quyền truy cập dữ liệu, thu hồi các bộ dữ liệu, hoặc ép buộc điều chỉnh nội dung để phục vụ các mục tiêu chính trị mới – giống hệt cách Circle đóng băng địa chỉ. Các nhà phát triển AI Trung Quốc sẽ phụ thuộc hoàn toàn vào một “Circle dữ liệu” kiểu này. Nếu họ xây dựng mô hình kinh doanh dựa trên dữ liệu đó, họ đang xây nhà trên một bãi cát pháp lý – bất kỳ thay đổi chính sách nào cũng có thể phá sản cả một thế hệ khởi nghiệp AI.

Điểm mù thứ hai: các quốc gia khác có thể tận dụng mối lo này để xây dựng hệ thống dữ liệu phi tập trung cạnh tranh. Nếu Hoa Kỳ hay Liên minh Châu Âu triển khai các kho dữ liệu mở với cơ chế quản trị đa bên (multi-stakeholder governance), minh bạch, có kiểm toán bên thứ ba và quyền truy cập mở cho mọi quốc gia trừ những quốc gia bị trừng phạt, họ sẽ tạo ra lợi thế cạnh tranh khổng lồ. Không phải ở khía cạnh số lượng dữ liệu – mà ở khía cạnh sự tin tưởng. Trong một thế giới ngày càng nhiều AI cần dữ liệu nhạy cảm, một tập dữ liệu không thể bị đóng băng sẽ có giá trị hơn nhiều một tập dữ liệu khổng lồ nhưng có thể bị rút phích cắm bất cứ lúc nào.

Tôi cũng nhìn thấy một vết nứt khác: sự cám dỗ của kiểm duyệt. Trung Quốc đã có một hệ thống kiểm duyệt internet tinh vi. Khi chính phủ tham gia trực tiếp vào việc thu thập và xử lý dữ liệu, việc “làm sạch” dữ liệu sẽ bao gồm cả việc lọc các slide thể hiện quan điểm chính trị không mong muốn. Nhưng các nhà nghiên cứu AI đều biết rằng dữ liệu càng bị lọc theo tiêu chí phi kỹ thuật, mô hình càng trở nên méo mó. Trong mô phỏng của tôi, khi tôi thêm một bộ lọc nội dung chính trị vào pipeline dữ liệu chuẩn, chỉ số đa dạng chủ đề giảm tới 31%. Điều này có nghĩa là các mô hình AI huấn luyện trên dữ liệu này sẽ rất giỏi trả lời các câu hỏi an toàn, nhưng gần như không thể xử lý các tình huống mơ hồ, các câu hỏi mang tính chất triết học hoặc các vấn đề đạo đức phức tạp – một yếu điểm nguy hiểm nếu AI được ứng dụng trong lĩnh vực y tế, tâm lý học hoặc giáo dục.

Takeaway: Bài học cho thị trường tiền mã hóa và tương lai dữ liệu AI

Điều tôi rút ra sau khi mô phỏng kế hoạch dữ liệu AI của Trung Quốc không chỉ là một báo cáo phân tích về một quốc gia cụ thể. Đó là một lời cảnh báo mang tính cấu trúc: việc tập trung hóa dữ liệu – dù dưới chiêu bài “chủ quyền dữ liệu”, “kiểm soát chất lượng” hay “an ninh quốc gia” – sẽ luôn tạo ra những vết nứt mà không ai lường trước. Đối với giới đầu tư tiền mã hóa và những người đang quan sát cuộc cạnh tranh AI toàn cầu, tôi muốn nói thế này: hãy ngừng chỉ nhìn vào bảng cân đối kế toán của các dự án AI, và bắt đầu nhìn vào kiến trúc dữ liệu của chúng. Một dự án AI có 10.000 GPU nhưng sử dụng dữ liệu từ một nhà cung cấp duy nhất có thể sụp đổ bất cứ lúc nào. Một dự án AI có 500 GPU nhưng sử dụng dữ liệu được quản trị phi tập trung, được kiểm toán độc lập sẽ có khả năng phục hồi cao hơn vô cùng.

Tôi vẫn còn day dứt với một câu hỏi chưa có lời giải: làm thế nào để xây dựng một bộ dữ liệu AI quy mô toàn cầu, có chất lượng cao, đồng thời vẫn minh bạch, có thể kiểm chứng và không thể bị một thực thể nào đóng băng vì lý do chính trị? Blockchain có thể không phải là câu trả lời duy nhất, nhưng những nguyên tắc thiết kế của blockchain – tính bất biến, phi tập trung, cơ chế đồng thuận và khả năng kiểm toán – chính là những gì một kho dữ liệu AI an toàn cần học hỏi. Nếu không, chúng ta sẽ không bao giờ có một AI thực sự thông minh và đáng tin cậy – chúng ta chỉ có những công cụ tinh vi phục vụ cho mệnh lệnh hành chính, giống như một bản hợp đồng thông minh có mã hoàn hảo nhưng lại được viết bởi một thực thể duy nhất: trông có vẻ vĩ đại trên giấy, nhưng chỉ cần một thay đổi nhỏ từ đơn vị phát hành là toàn bộ hệ thống sụp đổ.

Vết nứt nào cũng có lối vào. Lối vào của kế hoạch dữ liệu AI Trung Quốc không nằm ở con chip bị cấm, cũng không nằm ở số lượng nhân công gán nhãn. Nó nằm ở chính quyết định tập trung hóa quyền kiểm soát dữ liệu – một quyết định sẽ làm suy yếu khả năng học hỏi và thích nghi của mô hình AI theo thời gian. Và trong một thế giới mà AI đang được triển khai ở mọi ngóc ngách của nền kinh tế, một hệ thống mất đi khả năng thích nghi chính là một hệ thống đang nuôi dưỡng vết nứt trong nền móng của chính nó. Liệu các nhà lãnh đạo Trung Quốc có nhận ra điều này trước khi quá muộn? Hay họ sẽ phải học từ những cú sập đắt giá giống như cách tôi đã học từ những lỗ hổng của 0x Protocol – chỉ sau khi số tiền thật đã bị mất?

Giá thị trường

Tiền điện tử Giá 24h
BTC Bitcoin
$77,682.3 -2.38%
ETH Ethereum
$2,441.49 -1.70%
SOL Solana
$103.98 -2.62%
BNB BNB Chain
$690.7 -2.54%
XRP XRP Ledger
$1.39 -2.22%
DOGE Dogecoin
$0.0852 -2.58%
ADA Cardano
$0.2014 -4.00%
AVAX Avalanche
$7.3 -1.72%
DOT Polkadot
$0.8447 -2.54%
LINK Chainlink
$11.38 -2.83%

Sợ & Tham

68

Tham lam

Tâm lý thị trường

Tin nhanh 7x24h

Thêm >
{{快讯列表(10)}} {{loop}}
{{快讯时间}}

{{快讯内容}}

{{快讯标签}}
{{/loop}} {{/快讯列表}}

Lịch sự kiện blockchain

{{年份}}
18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

🧮 Công cụ

Tất cả →

Chỉ số mùa altcoin

41

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$77,682.3
1
Ethereum ETH
$2,441.49
1
Solana SOL
$103.98
1
BNB Chain BNB
$690.7
1
XRP Ledger XRP
$1.39
1
Dogecoin DOGE
$0.0852
1
Cardano ADA
$0.2014
1
Avalanche AVAX
$7.3
1
Polkadot DOT
$0.8447
1
Chainlink LINK
$11.38

🐋 Theo dõi cá voi

🟢
0xbb45...55ea
30 phút trước
Chuyển vào
1,224,591 USDT
🟢
0xa996...8f53
1 giờ trước
Chuyển vào
26,077 BNB
🔴
0xf624...7595
5 phút trước
Chuyển ra
3,310.49 BTC

💡 Smart Money

0xff3a...4550
Nhà giao dịch on-chain dày dặn
+$0.4M
76%
0xffe0...9c26
Bot chênh lệch giá
+$5.0M
62%
0x2b0f...a4fa
Ví lưu ký tổ chức
+$4.4M
77%