Tóm tắt nhanh: Một nghiên cứu quan trọng của Geirhos và cộng sự (2018) cho thấy các mô hình ảnh tiêu chuẩn nhận diện vật thể chủ yếu dựa vào kết cấu bề mặt, trong khi con người dựa vào hình dạng. Thiên kiến kết cấu này giải thích nhiều thất bại của thị giác máy tính, và bài báo đưa ra một cách khắc phục thực tế: huấn luyện lại mạng trên một tập dữ liệu đã bị loại bỏ tín hiệu kết cấu, giúp mô hình chuyển sang thiên kiến hình dạng giống con người, cải thiện cả độ chính xác lẫn độ bền vững.

Thiên kiến kết cấu trong mạng nơ-ron tích chập là gì?
Mạng nơ-ron tích chập (CNN) là mô hình học sâu học các đặc trưng thị giác từ ảnh qua nhiều lớp bộ lọc xếp chồng. Giả định phổ biến là CNN xây dựng hiểu biết theo tầng, từ cạnh và màu sắc lên tới hình dạng phức tạp như ô tô hay con chó. Thiên kiến kết cấu là phát hiện đi ngược lại bức tranh đó.
Nó mô tả xu hướng của một CNN huấn luyện trên ImageNet ra quyết định dựa vào kết cấu cục bộ, tức hoa văn bề mặt của vật thể, thay vì hình dạng tổng thể. Điều này quan trọng vì kết cấu và hình dạng thường trùng khớp, nên mô hình có thể đúng vì lý do sai. Thiên kiến kết cấu chỉ lộ ra khi hai tín hiệu này bị đặt vào thế xung đột.
Các nhà nghiên cứu đo thiên kiến kết cấu bằng cách nào?
Nhóm nghiên cứu dùng các ảnh xung đột tín hiệu tạo bằng kỹ thuật chuyển phong cách. Họ lấy hình dạng của một vật, ví dụ con mèo, rồi phủ lên kết cấu của một vật khác, ví dụ da voi. Một người nhìn ảnh này vẫn trả lời con mèo, vì con người phân loại theo hình dạng.
Ngược lại, một CNN huấn luyện trên ImageNet tiêu chuẩn có xu hướng trả lời con voi, cho thấy kết cấu chứ không phải hình dạng đang dẫn dắt dự đoán. Qua nhiều ảnh như vậy và nhiều kiến trúc nổi tiếng như ResNet, VGG, GoogLeNet và AlexNet, mô thức này nhất quán. Thiên kiến kết cấu vì thế không phải nét riêng của một mô hình mà là đặc tính chung của cách các mạng học từ ImageNet.
Vì sao thiên kiến kết cấu quan trọng với AI đáng tin cậy?
Thiên kiến kết cấu không chỉ là chuyện học thuật. Một mô hình dựa vào kết cấu sẽ mong manh trong thực tế. Thay đổi thống kê bề mặt của ảnh, qua nhiễu, mờ, thời tiết, nén hay đổi phong cách, một mạng phụ thuộc kết cấu có thể phân loại sai một vật thể mà hình dạng vẫn còn nguyên vẹn. Con người hầu như không bị ảnh hưởng vì hình dạng được giữ nguyên.
Điều này gắn thiên kiến kết cấu trực tiếp với độ bền vững. Nhiều thất bại được ghi nhận của hệ thống thị giác máy tính, từ đọc sai ảnh bị biến dạng tới sụp đổ trước các nhiễu nhỏ, đều nhất quán với một mô hình học lối tắt kết cấu thay vì cấu trúc vật thể. Với các ứng dụng quan trọng như ảnh y tế, xe tự lái hay kiểm tra công nghiệp, một mô hình nhận biết hình dạng đáng tin hơn nhiều.

Làm sao giảm thiên kiến kết cấu trong mô hình?
Đóng góp hữu ích nhất của bài báo là một giải pháp. Nhóm tác giả xây dựng tập huấn luyện mới tên Stylized-ImageNet, tạo ra bằng cách áp dụng chuyển phong cách lên mọi ảnh ImageNet để kết cấu gốc bị thay bằng phong cách nghệ thuật ngẫu nhiên. Vì kết cấu bị ngẫu nhiên hóa, nó không còn là tín hiệu đáng tin, nên mạng buộc phải dựa vào hình dạng để nhận diện.
Kết quả rất ấn tượng. Một mạng ResNet-50 huấn luyện trên Stylized-ImageNet phát triển thiên kiến hình dạng mạnh hơn hẳn, gần với cảm nhận của con người. Nó cũng bền vững hơn trước nhiều loại biến dạng và hư hại ảnh chưa từng thấy khi huấn luyện, và còn cải thiện phát hiện vật thể khi dùng làm mạng nền. Giảm thiên kiến kết cấu, do đó, không làm mất độ chính xác mà tăng khả năng chống chịu.
Với người làm thực tế, bài học là một bộ công cụ cụ thể. Tăng cường dữ liệu thay đổi kết cấu và phong cách, huấn luyện trên dữ liệu đã ngẫu nhiên hóa kết cấu, và đánh giá trên các phép thử xung đột tín hiệu và hư hại ảnh đều giúp phát hiện và giảm thiên kiến kết cấu. Bài học rộng hơn là mô hình học điều mà dữ liệu làm cho dễ, nên định hình dữ liệu thường mạnh hơn tinh chỉnh kiến trúc.
Thiên kiến kết cấu dạy gì về chất lượng dữ liệu?
Bài học sâu nhất của thiên kiến kết cấu là về dữ liệu, không phải mô hình. Mạng là cỗ máy tìm lối tắt hiệu quả. Nếu dữ liệu huấn luyện cho phép kết cấu giải quyết bài toán, mô hình sẽ dùng kết cấu, ngay cả khi ta mong nó học hình dạng. Đây là một trường hợp của học lối tắt, khi mô hình bám vào tín hiệu bề mặt tương quan với nhãn thay vì khái niệm ta thực sự quan tâm.
Vì vậy, các tập dữ liệu được tuyển chọn kỹ, mô tả rõ và cố ý đa dạng rất quan trọng. Hiểu phân phối của một tập dữ liệu, các thiên lệch và điểm mù của nó là điều kiện tiên quyết để xây mô hình khái quát tốt. Đây chính là lĩnh vực DataCore tập trung. Bạn có thể tham khảo thêm bài về bùng nổ trung tâm dữ liệu AI tại Việt Nam và khám phá nền tảng dữ liệu DataCore với các tập dữ liệu chuẩn hóa, dễ đọc bằng máy.


Hình dạng, kết cấu và cách con người thực sự nhìn
Nhiều thập kỷ nghiên cứu tri giác cho thấy con người nhận diện vật thể phần lớn qua hình khối tổng thể và cách sắp xếp các bộ phận. Một đứa trẻ có thể nhận ra chiếc ghế vẽ bằng nét viền đơn giản, không màu, không chi tiết bề mặt, vì chỉ riêng hình dạng đã mang danh tính. Bề mặt có ích nhưng thứ yếu so với cấu trúc.
Trước nghiên cứu này, nhiều người giả định mạng sâu cũng hội tụ về điều tương tự, theo trực giác rằng lớp đầu bắt cạnh, lớp giữa ghép bộ phận, lớp cuối biểu diễn vật thể. Các thí nghiệm xung đột tín hiệu đã chọc thủng trực giác đó. Khi lối dễ dẫn tới nhãn đúng đi qua kết cấu, mạng chọn lối đó, và thiên kiến kết cấu cho thấy độ chính xác cao trên benchmark có thể tồn tại song song với một biểu diễn khác hẳn tri giác con người.
Học lối tắt và mô thức rộng hơn
Thiên kiến kết cấu là một ví dụ của hiện tượng rộng hơn gọi là học lối tắt. Hết trường hợp này tới trường hợp khác, mô hình phát hiện các tương quan bề mặt tình cờ dự đoán được nhãn trên phân phối huấn luyện nhưng thất bại khi tương quan đó vỡ. Một bộ phân loại viêm phổi bám vào loại máy chụp, một bộ phát hiện động vật bám vào nền ảnh, đều theo cùng logic như mạng bám vào kết cấu.
Nhìn các trường hợp này như một họ giúp làm rõ vấn đề. Vấn đề hiếm khi là mô hình hỏng; vấn đề là dữ liệu đã mời gọi một lối dễ hơn tới đáp án so với khái niệm ta muốn. Cách sửa cũng từ đó: nếu muốn mô hình học khái niệm, hãy xây dữ liệu và phép đánh giá nơi lối tắt không còn hiệu quả, buộc mạng vào tín hiệu khó hơn nhưng khái quát hơn.
Quy trình thực tế cho các nhóm kỹ thuật
Biến nghiên cứu thành thực hành theo một trình tự rõ ràng. Trước hết, dò tìm thiên kiến kết cấu: chạy thử xung đột tín hiệu và đánh giá trên ảnh bị hư hại hoặc ngoài phân phối để xem hiệu năng có sụp khi thống kê bề mặt thay đổi hay không. Kế đến, nếu có, hãy can thiệp vào dữ liệu bằng tăng cường phong cách và kết cấu hoặc huấn luyện stylized.
Thứ ba, đánh giá lại trên cùng các phép thử và xác nhận độ bền vững cải thiện mà không mất độ chính xác trên dữ liệu sạch. Thứ tư, ghi lại tài liệu về tập dữ liệu và các phép thử để nhóm sau kế thừa tri thức. Xuyên suốt, chủ đề lặp lại là đo lường: bạn không thể quản lý một thiên lệch mà mình chưa bao giờ kiểm tra, và một con số chính xác duy nhất sẽ vui vẻ che giấu nó.
Giới hạn và điều diễn ra sau đó
Như mọi nghiên cứu, công trình này có ranh giới. Phương pháp xung đột tín hiệu dùng ảnh nhân tạo, và cảnh thực tế hiếm khi đặt hình dạng chọi kết cấu sạch sẽ như vậy, nên các con số mô tả một phép dò có kiểm soát chứ không phải hiệu năng thường ngày. Công trình cũng tập trung vào mạng tích chập huấn luyện trên ImageNet.
Dù vậy, hướng của phát hiện vẫn vững và ảnh hưởng nhiều nghiên cứu về sau, gồm cách các kiến trúc mới như vision transformer cân bằng hình dạng và kết cấu. Con số cụ thể thay đổi theo từng nghiên cứu, nhưng thông điệp trung tâm bền vững: thiên kiến quy nạp của mô hình thị giác bị định hình mạnh bởi dữ liệu và quy trình huấn luyện, và có thể được lái một cách chủ đích. Đó là mặt lạc quan của câu chuyện thiên kiến kết cấu.
Thiên kiến kết cấu: câu hỏi thường gặp
Thiên kiến kết cấu là gì, nói đơn giản?
Thiên kiến kết cấu là xu hướng mô hình ảnh nhận diện vật thể theo hoa văn bề mặt thay vì hình dạng tổng thể. Khi hình dạng và kết cấu bất đồng, mô hình thiên kiến kết cấu đi theo kết cấu, còn con người đi theo hình dạng.
Có phải mọi CNN đều có thiên kiến kết cấu?
Nghiên cứu tìm thấy thiên kiến kết cấu mạnh ở nhiều kiến trúc tiêu chuẩn huấn luyện trên ImageNet, nên đây là đặc tính chung của cách huấn luyện điển hình. Mức độ có thể thay đổi bằng cách đổi dữ liệu huấn luyện.
Đọc nghiên cứu gốc ở đâu?
Phát hiện đến từ Geirhos và cộng sự, "ImageNet-trained CNNs are Biased Towards Texture; Increasing Shape Bias Improves Accuracy and Robustness", có trên arXiv.
Bài viết tóm tắt nghiên cứu học sâu đã công bố cho mục đích giáo dục. Các phát hiện được ghi nhận cho nhóm tác giả gốc nêu trên.
Thiên kiến kết cấu có xuất hiện ở các kiến trúc mới như Vision Transformer không? Có, nhưng ở mức độ khác nhau. Các nghiên cứu tiếp nối Geirhos 2018 cho thấy Vision Transformer thường thiên về hình dạng nhiều hơn mạng tích chập truyền thống, song mức độ phụ thuộc kết cấu vẫn thay đổi theo dữ liệu huấn luyện và phương pháp tăng cường dữ liệu. Nói cách khác, thiên kiến kết cấu là thuộc tính của cả kiến trúc lẫn dữ liệu, nên mọi quy trình đánh giá mô hình thị giác máy tính vẫn cần bài kiểm tra xung đột hình dạng và kết cấu, bất kể kiến trúc nào đang được sử dụng.






Để lại một bình luận
Bạn phải đăng nhập để gửi bình luận.