BTC $62,849.2 -0.15%
ETH $1,847.41 -0.87%
SOL $71.96 -1.29%
BNB $576.1 -1.86%
XRP $1.06 -0.22%
DOGE $0.0691 -0.95%
ADA $0.1748 +3.86%
AVAX $6.2 -3.15%
DOT $0.7804 +2.66%
LINK $8.08 -1.08%
⛽ ETH Gas 28 Gwei
Sợ&Tham
27

Giá thị trường

BTC Bitcoin
$62,849.2 -0.15%
ETH Ethereum
$1,847.41 -0.87%
SOL Solana
$71.96 -1.29%
BNB BNB Chain
$576.1 -1.86%
XRP XRP Ledger
$1.06 -0.22%
DOGE Dogecoin
$0.0691 -0.95%
ADA Cardano
$0.1748 +3.86%
AVAX Avalanche
$6.2 -3.15%
DOT Polkadot
$0.7804 +2.66%
LINK Chainlink
$8.08 -1.08%

Lịch sự kiện blockchain

{{年份}}
10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

🧮 Công cụ

Tất cả →

Chỉ số mùa altcoin

44

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$62,849.2
1
Ethereum ETH
$1,847.41
1
Solana SOL
$71.96
1
BNB Chain BNB
$576.1
1
XRP Ledger XRP
$1.06
1
Dogecoin DOGE
$0.0691
1
Cardano ADA
$0.1748
1
Avalanche AVAX
$6.2
1
Polkadot DOT
$0.7804
1
Chainlink LINK
$8.08

🐋 Theo dõi cá voi

🟢
0x31cc...f294
1 giờ trước
Chuyển vào
9,279,253 DOGE
🟢
0xa168...787e
5 phút trước
Chuyển vào
2,585.92 BTC
🔴
0xb6ad...da4b
6 giờ trước
Chuyển ra
2,541 ETH

Khi AI 'ngây thơ' trở thành công cụ tuyên truyền: Bài toán dữ liệu chưa có lời giải

Pháp lý | Hoàng Hải |

Rất có thể, thứ đang 'học' từ dữ liệu không chỉ là ngữ pháp mà còn là cả một hệ thống niềm tin.

Bài toán dữ liệu của AI chatbot không chỉ là kỹ thuật, mà còn là địa chính trị. Và khi một mô hình 'vô tình' lặp lại thông điệp của một chiến dịch tuyên truyền có chủ đích, vấn đề không còn nằm ở 'lỗi code' nữa.

Context: Khi dữ liệu không trung tính

Khi audit các hợp đồng thông minh, tôi thường nói: 'Mã nguồn không bao giờ nói dối, nhưng dữ liệu đầu vào thì có thể.' Với AI cũng vậy. Một mô hình ngôn ngữ lớn (LLM) là sản phẩm của hàng nghìn tỷ token đầu vào. Nếu dữ liệu đó chứa đựng các thông điệp tuyên truyền có tổ chức, mô hình sẽ 'học' và tái tạo chúng như những sự thật hiển nhiên.

Khác với tấn công trực tiếp vào giao thức blockchain – nơi bạn có thể kiểm tra từng dòng code để tìm lỗi – vấn đề này nằm ở lớp dữ liệu (data layer). Nó mờ, khó đo lường, và gần như không thể vá bằng một bản cập nhật phần mềm đơn giản.

Khi AI 'ngây thơ' trở thành công cụ tuyên truyền: Bài toán dữ liệu chưa có lời giải

Core: Phân tích từ góc nhìn kỹ thuật

Hãy tưởng tượng bạn huấn luyện một chatbot trên tập dữ liệu The Pile. Một phần đáng kể trong đó là nội dung từ các trang web có thiên hướng chính trị rõ rệt. Mô hình của bạn sẽ học rằng 'cách nói chuyện của các trang này là chuẩn mực'. Kết quả: khi được hỏi về một sự kiện lịch sử, chatbot trích dẫn các nguồn đó như thể chúng là tài liệu tham khảo trung lập nhất.

Điều này còn nguy hiểm hơn một lỗi overflow trong smart contract. Bởi vì: 1/ Nó không gây sập hệ thống, nên khó bị phát hiện. 2/ Nó ăn sâu vào kiến thức nền tảng của mô hình, khó loại bỏ bằng fine-tuning. 3/ Người dùng ban đầu tin tưởng AI, do đó độ tin cậy của thông tin sai lệch được gia tăng một cách giả tạo.

Từ kinh nghiệm audit của tôi, một trong những kỹ thuật phát hiện lỗi hiệu quả nhất là 'fuzzing' – đưa vào các đầu vào bất thường và xem hệ thống phản ứng thế nào. Với AI, kỹ thuật tương đương là 'red-teaming': cố tình đặt các câu hỏi về chủ đề nhạy cảm, nhưng với các từ ngữ trung lập, để xem mô hình có 'trượt' vào ngôn ngữ tuyên truyền không.

Điểm mấu chốt: Sự khác biệt giữa một mô hình 'an toàn' và một mô hình 'dễ bị lợi dụng' không nằm ở kiến trúc Transformer hay số lượng tham số, mà nằm ở chất lượng của bộ lọc dữ liệu đầu vào và kỹ thuật alignment.

Một giải pháp kỹ thuật đang được thảo luận nhiều là 'data provenance tracking' – gắn thẻ nguồn gốc cho từng phần dữ liệu trong tập huấn luyện, tương tự như cách chúng ta audit nguồn gốc tài sản trên blockchain. Nếu biết được rằng 0.01% dữ liệu đến từ một nguồn tuyên truyền đã biết, ta có thể giảm trọng số của nó hoặc loại bỏ hoàn toàn. Đây là một ứng dụng thú vị của khái niệm 'proof of origin' trong AI.

Tuy nhiên, giải pháp này có một trade-off lớn: nó làm tăng đáng kể chi phí xử lý và lưu trữ. Với các tập dữ liệu hàng trăm TB, việc duy trì một bảng ánh xạ nguồn gốc chi tiết là một bài toán hạ tầng không nhỏ. Nó giống như việc yêu cầu mọi giao dịch trên Ethereum đều phải kèm theo bằng chứng Merkle về nguồn gốc – khả thi về mặt kỹ thuật, nhưng đắt đỏ về mặt kinh tế.

Khi AI 'ngây thơ' trở thành công cụ tuyên truyền: Bài toán dữ liệu chưa có lời giải

Contrarian: Điểm mù của cộng đồng bảo mật

Chúng ta thường vội vàng đổ lỗi cho các mô hình AI 'có vấn đề' hoặc yêu cầu các công ty phải 'tốt hơn'. Nhưng tôi cho rằng điều này bỏ qua một khía cạnh quan trọng: bản thân khái niệm 'trung lập' trong dữ liệu là một ảo tưởng.

Trong blockchain, chúng ta có khái niệm 'giao thức trung lập' – một giao thức không thiên vị bất kỳ ai. Nhưng dữ liệu đào tạo AI thì không bao giờ trung lập. Nó là sản phẩm của văn hóa, lịch sử, và quyền lực. Một tập dữ liệu lấy từ Internet Anh ngữ sẽ mang thiên kiến của phương Tây. Một tập dữ liệu từ mạng xã hội Trung Quốc sẽ mang thiên kiến khác. 'Loại bỏ tuyên truyền' không phải là loại bỏ một thứ độc hại, mà là chọn lọc một phiên bản của 'sự thật'.

Điểm mù thực sự là: bằng cách tập trung vào 'vô tình' lan truyền thông tin sai lệch, chúng ta đang tạo ra một cái cớ hoàn hảo cho các hành vi có chủ đích. Một tác nhân nhà nước có thể dễ dàng 'vô tình' đưa dữ liệu thiên vị vào một tập huấn luyện mã nguồn mở, và sau đó đổ lỗi cho 'lỗi mô hình' khi thông tin sai lệch xuất hiện. Không có một 'chữ ký' nào trong code để truy vết hành vi đó.

Nếu muốn audit một AI chatbot về độ tin cậy, bạn không thể chỉ kiểm tra output của nó. Bạn phải kiểm tra toàn bộ pipeline: từ nguồn dữ liệu gốc, quá trình lọc, đến phương pháp alignment. Đây là một bài toán khó hơn nhiều so với audit smart contract.

Takeaway: Dự báo về một cuộc khủng hoảng niềm tin

Trong vòng 2 năm tới, tôi dự đoán sẽ xuất hiện ít nhất một vụ bê bối lớn, nơi một chatbot nổi tiếng bị phát hiện 'vô tình' tái tạo nội dung tuyên truyền của một quốc gia có chủ quyền. Hệ quả: làn sóng yêu cầu minh bạch dữ liệu huấn luyện, tương tự như 'proof of reserves' trong crypto, sẽ trở thành yêu cầu pháp lý bắt buộc.

Khi AI 'ngây thơ' trở thành công cụ tuyên truyền: Bài toán dữ liệu chưa có lời giải

Liệu các công ty AI có sẵn sàng công bố 'proof of data provenance' cho mô hình của mình? Hay họ sẽ chọn cách im lặng, và đánh đổi niềm tin của người dùng?

ZK proof: im lặng nhưng vạn lời.

Sợ & Tham

27

Sợ hãi

Tâm lý thị trường

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

💡 Smart Money

0x07ef...0ea3
Thợ đào DeFi hàng đầu
+$4.0M
88%
0xdbe2...fd01
Ví lưu ký tổ chức
+$2.3M
79%
0x1045...8273
Nhà giao dịch on-chain dày dặn
+$1.3M
72%