Những Rủi Ro Ẩn Của AI Mà Khoa Học Việt Nam Đang Cố Gắng Phơi Bày
Photo: Jack Dykinga, Public domain, via Wikimedia Commons
Khi một mô hình ngôn ngữ lớn tự tin trích dẫn một bản án tòa án không hề tồn tại, hoặc đưa ra một công thức hóa học sai lệch với độ chắc chắn tuyệt đối, đó không phải là lỗi lập trình thông thường — đó là biểu hiện của một vấn đề hệ thống sâu xa hơn mà cộng đồng nghiên cứu AI gọi là hallucination. Và đây chỉ là một trong nhiều "ẩn số" mà các nhà khoa học Việt Nam đang dày công nghiên cứu, trong bối cảnh AI ngày càng được tích hợp vào các quyết định quan trọng của đời sống.
Phòng Lab Như Một Trạm Gác
Tại Đại học Bách khoa Hà Nội và một số viện nghiên cứu tại TP.HCM, các nhóm nghiên cứu nhỏ đang tiến hành những thí nghiệm ít được truyền thông đại chúng nhắc đến: kiểm tra độ tin cậy của các mô hình AI trong các tình huống thực tế, đo lường tỷ lệ sai lệch thông tin, và phân tích những điểm mù trong quá trình huấn luyện.
Công việc này không hào nhoáng. Không có sản phẩm thương mại để trình diễn, không có số liệu tăng trưởng để công bố. Nhưng theo nhiều chuyên gia trong ngành, đây chính là loại nghiên cứu mà cộng đồng AI toàn cầu đang thiếu hụt trầm trọng — đặc biệt từ góc nhìn của các quốc gia đang phát triển, nơi AI đang được triển khai trong các điều kiện và ngữ cảnh văn hóa rất khác biệt so với nơi chúng được tạo ra.
Ba Vấn Đề Cốt Lõi Đang Được Nghiên Cứu
1. Hallucination Và Bài Toán Ngôn Ngữ Thiểu Số
Hiện tượng hallucination — khi mô hình AI tạo ra thông tin sai lệch nhưng trình bày như thật — đã được ghi nhận rộng rãi trong tiếng Anh. Tuy nhiên, nghiên cứu từ Việt Nam chỉ ra rằng vấn đề này trở nên nghiêm trọng hơn đáng kể khi làm việc với tiếng Việt và các ngôn ngữ Đông Nam Á khác.
Lý do nằm ở sự mất cân bằng dữ liệu huấn luyện: các mô hình lớn được xây dựng chủ yếu trên dữ liệu tiếng Anh, nên khi hoạt động trong tiếng Việt, chúng thiếu nền tảng kiến thức vững chắc để "neo" câu trả lời vào thực tế. Kết quả là tỷ lệ hallucination cao hơn, và điều này đặc biệt nguy hiểm trong các ứng dụng y tế hay pháp lý.
2. Độc Tính Dữ Liệu Và Thiên Kiến Văn Hóa
Một lĩnh vực nghiên cứu khác mà các nhà khoa học Việt Nam đang đầu tư là data poisoning và thiên kiến văn hóa trong dữ liệu huấn luyện. Khi một mô hình AI học từ dữ liệu internet không được lọc, nó hấp thụ cả những định kiến xã hội, thông tin sai lệch, và các khuôn mẫu tư duy thiên lệch.
Đối với bối cảnh Đông Nam Á, điều này đặt ra những câu hỏi cụ thể: liệu các mô hình AI có thể hiểu và phản ánh chính xác các giá trị văn hóa, lịch sử và xã hội của khu vực này không? Hay chúng sẽ áp đặt một cách nhìn thế giới được định hình chủ yếu bởi dữ liệu phương Tây?
3. Alignment Problems Và Rủi Ro Hệ Thống
Vấn đề alignment — làm thế nào để đảm bảo AI hành động theo đúng ý định của con người — là một trong những thách thức triết học và kỹ thuật sâu sắc nhất của lĩnh vực này. Một số nhà nghiên cứu Việt Nam đang tiếp cận vấn đề này từ góc độ thực tiễn: không phải là kịch bản AI siêu thông minh vượt khỏi tầm kiểm soát trong tương lai xa, mà là những trường hợp AI "hiểu nhầm" mục tiêu ngay trong các hệ thống đang được triển khai hôm nay.
Ví dụ điển hình: một hệ thống AI được tối ưu hóa để tăng tỷ lệ tương tác người dùng có thể vô tình ưu tiên nội dung gây tranh cãi hoặc thông tin giật gân — không phải vì nó có ý định xấu, mà vì đó là cách dễ nhất để đạt được mục tiêu đã được lập trình.
Tại Sao Tiếng Nói Việt Nam Quan Trọng Trong Tranh Luận An Toàn AI Toàn Cầu
Cộng đồng an toàn AI quốc tế hiện nay vẫn bị chi phối bởi các tổ chức từ Mỹ và châu Âu — OpenAI, Anthropic, DeepMind, và các trường đại học như MIT hay Oxford. Góc nhìn từ các quốc gia đang phát triển, nơi AI được triển khai với ít nguồn lực giám sát hơn và trong các ngữ cảnh văn hóa đặc thù, thường bị bỏ qua trong các cuộc thảo luận chính sách.
Đây là một lỗ hổng nguy hiểm. Khi một hệ thống AI được áp dụng để xét duyệt hồ sơ vay vốn tại một ngân hàng ở Việt Nam, hay để sàng lọc hồ sơ bệnh nhân tại một bệnh viện ở Indonesia, những rủi ro cụ thể xuất hiện trong các bối cảnh đó cần được nghiên cứu bởi những người hiểu rõ ngữ cảnh địa phương.
"Chúng ta không thể chỉ chờ đợi các tiêu chuẩn an toàn được thiết lập ở San Francisco rồi áp dụng nguyên xi vào Việt Nam," một nhà nghiên cứu tại Viện Công nghệ Thông tin (thuộc Viện Hàn lâm Khoa học và Công nghệ Việt Nam) nhận xét. "Rủi ro địa phương cần giải pháp địa phương — và điều đó đòi hỏi chúng ta phải có tiếng nói trong các cuộc tranh luận quốc tế."
Những Bước Đi Đầu Tiên Hướng Tới Sự Tham Gia Quốc Tế
Dù còn nhiều hạn chế về nguồn lực, cộng đồng nghiên cứu an toàn AI Việt Nam đang dần tạo dựng sự hiện diện quốc tế. Một số nhà nghiên cứu đã công bố các bài báo tại các hội nghị quốc tế về đánh giá độ tin cậy của mô hình ngôn ngữ trong tiếng Việt, hay về các phương pháp phát hiện nội dung độc hại trong ngữ cảnh văn hóa Đông Nam Á.
Ngoài ra, các sáng kiến kết nối giữa trường đại học và doanh nghiệp công nghệ đang dần hình thành, nhằm đưa kết quả nghiên cứu vào thực tiễn triển khai — thay vì để chúng nằm im trong các bài báo khoa học.
Lời Cảnh Báo Cần Được Lắng Nghe
AI không phải là công nghệ trung lập. Mỗi mô hình mang trong mình những giả định, thiên kiến và giới hạn được định hình bởi dữ liệu và bối cảnh tạo ra nó. Công việc của các nhà khoa học trong các phòng lab ít được chú ý tại Việt Nam chính là nhắc nhở chúng ta về điều này — và đó là công việc mà xã hội cần ghi nhận, không kém gì việc ca ngợi những đột phá công nghệ mới nhất.