TL;DR: Bài báo "ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness" (Geirhos và cộng sự, 2018, công bố tại ICLR 2019) chỉ ra rằng mạng nơ-ron tích chập chủ yếu phân loại ảnh theo bề mặt texture, trong khi con người phân loại theo hình dạng. Một con mèo khoác da voi là con voi với ResNet-50 tiêu chuẩn, và là con mèo với gần như mọi con người. Nhóm tác giả đo thiên vị này bằng thí nghiệm xung đột tín hiệu, rồi giảm nó bằng cách huấn luyện trên Stylized-ImageNet, bộ dữ liệu xáo trộn texture buộc mạng nơ-ron tích chập học theo hình dạng và bền hơn trước nhiễu ảnh.
Bài viết giải thích thí nghiệm, cách khắc phục, các đánh đổi và bài học còn nguyên giá trị cho đội ngũ triển khai mô hình thị giác hôm nay.
Bài Báo Của Geirhos Phát Hiện Điều Gì Về Mạng Nơ-ron Tích Chập?
Nghiên cứu do Robert Geirhos tại Đại học Tubingen dẫn dắt trả lời một câu hỏi thường bị gạt đi như hộp đen: mạng nơ-ron tích chập (Convolutional Neural Network, CNN) huấn luyện trên ImageNet thực sự học gì? Quan niệm phổ biến cho rằng mạng nơ-ron tích chập khai thác cấu trúc phân tầng của vật thể, xây từ đặc trưng cấp thấp như cạnh và màu lên tới hình dạng phức tạp như ô tô, con chó.
Bài báo thách thức câu chuyện đó bằng một kết luận đơn giản mà gây sốc: con người nhận diện vật thể chủ yếu theo hình dạng, còn mạng nơ-ron tích chập tiêu chuẩn mang thiên vị texture nặng.
Nhóm tác giả đi xa hơn việc mô tả hiện tượng. Họ xây một bộ dữ liệu được thiết kế để cấy thiên hướng giống người vào chính các kiến trúc đó, chứng minh thiên vị texture không phải thuộc tính cố hữu của mạng nơ-ron tích chập mà là hệ quả của dữ liệu huấn luyện. Cú đổi khung đó, từ "mô hình bị lỗi" sang "tín hiệu huấn luyện thưởng cho manh mối sai", là lý do bài báo vẫn nằm trong danh sách đọc kinh điển của giới học máy.
Mạng Nơ-ron Tích Chập Nhìn Bằng Gì: Hình Dạng Hay Texture?
Bằng chứng cốt lõi đến từ ảnh xung đột tín hiệu: những bức ảnh có hình dạng thuộc lớp này còn texture thuộc lớp khác, tạo bằng style transfer. Đưa ảnh hình mèo khoác da voi cho một người, câu trả lời là mèo, vì thị giác con người coi hình dạng là tín hiệu chi phối. Đưa cùng bức ảnh cho mạng nơ-ron tích chập ResNet-50 huấn luyện trên ImageNet, câu trả lời là voi, vì quyết định của mạng đi theo texture.

Điểm rút ra từ hình: sự bất đồng giữa câu trả lời của người và của mạng nơ-ron tích chập trên cùng một ảnh chính là phép đo thiên vị texture; không cần mổ xẻ bên trong mạng.
Trên toàn bộ tập ảnh xung đột, người quan sát trong điều kiện phòng thí nghiệm có kiểm soát dựa vào hình dạng cho đại đa số quyết định. Các mạng nơ-ron tích chập huấn luyện trên ImageNet đảo ngược tỷ lệ đó, nghiêng về texture trong phần lớn xung đột. Khoảng cách giữ nguyên qua nhiều kiến trúc, gồm AlexNet, VGG-16, GoogLeNet và ResNet-50, cho thấy thiên vị texture đến từ phân phối huấn luyện chứ không từ một lựa chọn thiết kế riêng lẻ.
Vì Sao Huấn Luyện Trên ImageNet Sinh Ra Thiên Vị Texture?
Về mặt thống kê, texture là lối tắt tuyệt vời. Trong ảnh tự nhiên, da voi hầu như chỉ xuất hiện trên voi, nên một mạng nơ-ron tích chập bám vào mảng texture cục bộ có thể đạt độ chính xác ImageNet cao mà chưa từng ghép nổi hình dạng toàn cục. Phép tích chập với vùng tiếp nhận hạn chế khiến lối tắt dễ biểu diễn, và quy trình huấn luyện tiêu chuẩn khiến nó sinh lời. Không gì trong hàm mất mát thưởng cho việc nhìn thấy cả con vật.
Đó là lý do nhóm tác giả mô tả thiên vị texture như một chiến lược học được, không phải khiếm khuyết. Mạng nơ-ron tích chập giải bộ dữ liệu nó được giao, không phải bài toán mà người thiết kế tưởng tượng. Công trình sau đó của cùng nhóm tổng quát hóa nhận xét này dưới tên gọi học tắt (shortcut learning): mạng nơ-ron tích chập khai thác bất kỳ quy luật giả nào tách được các lớp, dù là texture, bối cảnh nền, watermark hay dấu vết máy quét đặc thù bệnh viện trong ảnh y tế.
Stylized-ImageNet Là Gì Và Giảm Thiên Vị Texture Ra Sao?
Đóng góp mang tính xây dựng của bài báo là Stylized-ImageNet (SIN): bản sao ImageNet trong đó texture gốc của mỗi ảnh bị bóc đi và thay bằng phong cách của một bức tranh chọn ngẫu nhiên, dùng kỹ thuật style transfer AdaIN. Hình dạng sống sót qua phép biến đổi; texture trở thành nhiễu vô nghĩa. Mạng nơ-ron tích chập huấn luyện trên SIN vì vậy không dùng được lối tắt texture và buộc phải học hình dạng.

Kết quả nhất quán. Mạng nơ-ron tích chập ResNet-50 huấn luyện trên SIN lật từ quyết định nghiêng texture sang nghiêng hình dạng trong bài kiểm tra xung đột, tiến gần hành vi con người hơn hẳn. Thiết thực hơn, chiến lược dựa hình dạng tổng quát hóa tốt hơn: mạng nơ-ron tích chập huấn luyện trên SIN bền rõ rệt trước các biến dạng ảnh chưa từng gặp như nhiễu, thay đổi tương phản và các dạng hỏng ảnh khác, đồng thời cải thiện hiệu năng chuyển giao sang phát hiện vật thể khi làm backbone cho Faster R-CNN trên Pascal VOC.
Nhóm tác giả thẳng thắn về đánh đổi. Huấn luyện chỉ trên SIN tốn vài điểm phần trăm độ chính xác trên ảnh tự nhiên, vì texture thực sự hữu ích khi nó không đánh lừa. Mạng nơ-ron tích chập huấn luyện trên SIN cũng dễ tổn thương hơn trước ảnh mờ, bởi mờ phá hủy đường nét hình dạng mà chúng giờ phụ thuộc. Công thức thực dụng nhất trong bài là huấn luyện kết hợp ImageNet cộng SIN, lấy lại độ chính xác ảnh tự nhiên trong khi giữ phần lớn độ bền.
Vì Sao Ta Muốn Mạng Nơ-ron Tích Chập Mang Thiên Hướng Giống Người?
Câu hỏi nghe triết học nhưng có câu trả lời kỹ thuật. Mục tiêu huấn luyện một mạng nơ-ron tích chập không phải điểm cao trên một bộ dữ liệu, mà là hành xử hợp lý trên phân phối ảnh mở mà thế giới thực sẽ tạo ra. Thị giác con người là bằng chứng tồn tại của một chiến lược tổng quát hóa qua ánh sáng, thời tiết, che khuất và góc nhìn mới.
Khi tín hiệu chi phối của mô hình khác với của chúng ta, như với thiên vị texture, thất bại của nó trở nên xa lạ: tự tin, có hệ thống và khó lường trước.
Quyết định dựa hình dạng cũng suy giảm êm hơn. Tín hiệu hình dạng xuống cấp gần giống cách hiệu năng con người xuống cấp, khiến hành vi của mạng nơ-ron tích chập dễ suy luận, dễ kiểm toán và dễ giám sát hơn. Căn chỉnh thiên hướng quy nạp của máy theo con người vì vậy không phải bắt chước cho vui, mà là thừa hưởng một tỷ năm chạy thử nghiệm hiện trường.
Từ 2018 Đến Nay, Nghiên Cứu Thiên Vị Texture Đi Về Đâu?
Bài báo mở ra một nhánh nghiên cứu vẫn đang hoạt động. Các công trình tiếp nối xác lập rằng thiên vị texture cũng giảm được bằng tăng cường dữ liệu mạnh tay, và mức độ thiên vị phụ thuộc mục tiêu huấn luyện cùng độ đa dạng dữ liệu, không chỉ kiến trúc. Khi vision transformer (ViT) xuất hiện, nhiều nhóm đo chúng trên cùng bộ chuẩn xung đột tín hiệu và thấy chúng nghiêng hình dạng rõ rệt hơn mạng nơ-ron tích chập, dù vẫn chưa chạm mức con người.
Di sản rộng hơn là khung học tắt (Geirhos và cộng sự, 2020), coi thiên vị texture là một trường hợp của chế độ thất bại phổ quát: mạng sâu bám vào bất kỳ lối tắt thống kê nào bộ dữ liệu chào mời. Khung đó nay định hình cách giới thực hành xây bộ đánh giá, ưu tiên kiểm tra ngoài phân phối, chuẩn đo hỏng ảnh như ImageNet-C và chẩn đoán kiểu xung đột tín hiệu thay vì một con số xếp hạng duy nhất.

Thí Nghiệm So Sánh Người Và Máy Công Bằng Đến Đâu?
So sánh giữa người và mạng nơ-ron tích chập chỉ đáng tin khi kiểm soát tốt, và sự cẩn trọng phương pháp là phần lớn lý do kết quả thiên vị texture được chấp nhận. Ảnh kích thích được ánh xạ vào mười sáu nhóm cơ bản tương thích ImageNet như mèo, voi, ô tô, đồng hồ, để người và mô hình trả lời cùng câu hỏi trên cùng không gian nhãn.
Người tham gia xem ảnh trong thời gian ngắn dưới điều kiện phòng thí nghiệm, ngăn suy luận kéo dài và giữ bài toán gần với nhận diện truyền thẳng nhanh mà mạng nơ-ron tích chập thực hiện.
Quan trọng nhất, ảnh xung đột tín hiệu không có đáp án đúng. Khi hình dạng nói mèo và texture nói voi, câu trả lời nào cũng biện hộ được; thí nghiệm đo tín hiệu nào chi phối hệ thị giác của mỗi người quan sát. Thiết kế đó biến một câu hỏi mơ hồ về việc mạng học gì thành một tỷ số định lượng sạch, điểm thiên vị hình dạng, mà mọi mô hình sau này đều đo được. Đó là lý do bộ chuẩn vẫn được dùng thường quy để đánh giá kiến trúc mới nhiều năm sau công bố.

Nghiên Cứu Thiên Vị Texture Có Những Giới Hạn Gì?
Bài báo xứng đáng với ảnh hưởng của nó, nhưng người đọc nghiêm túc nên giữ bốn lưu ý. Thứ nhất, style transfer là con dao mổ không hoàn hảo: nó xáo trộn một phần thông tin hình dạng cùng với texture, nên phép tách tín hiệu mạnh nhưng không tuyệt đối. Thứ hai, đường cơ sở con người đến từ điều kiện xem phòng thí nghiệm; tri giác đời thường, với thời gian và bối cảnh không giới hạn, có thể cân tín hiệu khác đi.
Thứ ba, texture không phải kẻ xấu. Trong ảnh tự nhiên texture là tín hiệu hợp lệ, giàu thông tin, và một mạng nơ-ron tích chập bỏ qua nó hoàn toàn sẽ tệ hơn. Vấn đề mà nghiên cứu phơi bày là sự phụ thuộc quá mức vào một tín hiệu duy nhất dễ gãy khi phân phối thay đổi, không phải bản thân việc dùng tín hiệu.
Thứ tư, mức thiên vị định lượng thay đổi theo chi tiết huấn luyện; các lần tái lập sau này thấy tăng cường dữ liệu, hàm mục tiêu và quy mô dữ liệu đều dịch chuyển điểm thiên vị hình dạng, đôi khi đáng kể, mà không cần đổi kiến trúc.
Không lưu ý nào lật đổ phát hiện trung tâm. Chúng tinh chỉnh nó thành dạng mà giới thực hành thực sự dùng: các tín hiệu mà mạng nơ-ron tích chập dựa vào là thuộc tính đo được, điều chỉnh được của pipeline huấn luyện, và nên được đo thay vì giả định.
Đội Ngũ Nên Kiểm Tra Thiên Vị Texture Trong Mô Hình Của Mình Thế Nào?
Phương pháp của bài báo dịch thẳng thành một quy trình kiểm toán thực tế mà mọi đội xây mạng nơ-ron tích chập có thể chạy trước khi triển khai. Không bước nào đòi hỏi huấn luyện lại, và phần lớn tự động hóa được trong pipeline đánh giá.
- Xây bộ ảnh xung đột tín hiệu nhỏ cho miền của bạn. Style transfer hoặc hoán đổi texture giữa chính các lớp của bạn hé lộ mô hình thực sự đi theo tín hiệu nào, đúng cách các thí nghiệm gốc làm với các lớp ImageNet.
- Chạy chuẩn đo hỏng ảnh. Đánh giá trên phiên bản dữ liệu kiểm định bị thêm nhiễu, làm mờ, nén và đổi ánh sáng. Vách đứng độ chính xác dưới hỏng ảnh là chữ ký của sự phụ thuộc lối tắt.
- Kiểm tra độ nhạy bối cảnh nền. Tách vật thể và hoán đổi nền. Nếu dự đoán lật, mạng nơ-ron tích chập đang đọc bối cảnh, họ hàng của thiên vị texture, thay vì vật thể.
- So với đường cơ sở con người trên các ca khó. Nơi con người vẫn chính xác còn mô hình sụp đổ chính là ngân sách lệch phân phối mà hệ giám sát của bạn cần canh.
Thiên Vị Texture Có Ý Nghĩa Gì Với Đội Ngũ Dữ Liệu Việt Nam?
Với hệ thống sản xuất, thiên vị texture không phải chuyện hàn lâm; nó là ngân sách độ tin cậy. Xác thực danh tính là ví dụ nội địa rõ nhất: một pipeline eKYC xác minh giấy tờ và khuôn mặt Việt Nam phải giữ độ chính xác qua đủ loại camera điện thoại, điều kiện ánh sáng, chất lượng in và mức nén ảnh chưa từng gặp khi huấn luyện.
Một mạng nơ-ron tích chập dựa vào tín hiệu mức texture sẽ suy giảm đúng ở những điều kiện đó, và vì vậy đánh giá độ bền theo tinh thần của dòng nghiên cứu thiên vị texture được tích hợp vào cách DataCore kiểm định các mô hình đằng sau dịch vụ eKYC.
Bài học thiết kế dữ liệu còn đi xa hơn. Stylized-ImageNet hiệu quả vì nhóm tác giả đổi dữ liệu, không đổi kiến trúc, và đòn bẩy đó mở cho mọi đội: xây tập huấn luyện phá vỡ tương quan giả, và kiểm định trên dữ liệu cô lập đúng tín hiệu bạn muốn mạng nơ-ron tích chập sử dụng. Dữ liệu có cấu trúc, tài liệu hóa tốt như trong thư viện miền dữ liệu của DataCore là nguyên liệu thô cho kỷ luật đó.
Về bối cảnh AI rộng hơn tại Việt Nam, mời bạn đọc phân tích rủi ro tiếp cận mô hình AI năm 2026 và làn sóng đầu tư trung tâm dữ liệu AI, phần hạ tầng và nguồn cung của cùng vòng đời mô hình mà câu chuyện thiên vị texture này soi từ phía đánh giá.
Câu Hỏi Thường Gặp Về Thiên Vị Texture Của Mạng Nơ-ron Tích Chập
Thiên vị texture trong một câu là gì?
Là xu hướng của mạng nơ-ron tích chập huấn luyện trên ImageNet phân loại ảnh theo texture bề mặt thay vì hình dạng vật thể, ngược với tri giác con người, theo Geirhos và cộng sự (2018).
Thiên vị texture được đo thế nào?
Bằng ảnh xung đột tín hiệu ghép hình dạng của lớp này với texture của lớp khác. Tỷ lệ câu trả lời nhất quán với hình dạng là điểm thiên vị hình dạng; con người gần đỉnh thang, mạng nơ-ron tích chập tiêu chuẩn gần đáy.
Stylized-ImageNet có xóa hẳn thiên vị texture không?
Không. Nó đẩy mạng nghiêng mạnh về quyết định hình dạng và tăng độ bền trước hỏng ảnh, đổi lại vài điểm độ chính xác trên ảnh sạch và nhạy hơn với ảnh mờ. Huấn luyện kết hợp ImageNet cộng SIN là công thức cân bằng.
Vision transformer có thiên vị texture không?
Ít hơn mạng nơ-ron tích chập. Các nghiên cứu xung đột tín hiệu sau 2020 thấy ViT nghiêng hình dạng hơn đáng kể, dù khoảng cách tới mức dựa hình dạng của con người chưa khép hẳn, và rủi ro học tắt vẫn còn.
Vì sao doanh nghiệp nên quan tâm thiên vị texture?
Vì mô hình dựa texture thất bại dưới các dịch chuyển phân phối thường nhật của ảnh sản xuất: camera mới, nén, ánh sáng, thời tiết. Kiểm toán thiên vị texture trước triển khai rẻ hơn nhiều so với phát hiện nó trong một báo cáo sự cố.
Nguồn Tham Khảo
- Geirhos, R., Rubisch, P., Michaelis, C., Bethge, M., Wichmann, F. A., Brendel, W.: "ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness", arXiv 1811.12231, công bố tại ICLR 2019.
- Geirhos, R. và cộng sự: "Shortcut Learning in Deep Neural Networks", Nature Machine Intelligence (2020), arXiv 2004.07780.
- Mã nguồn và hướng dẫn Stylized-ImageNet: github.com/rgeirhos/Stylized-ImageNet.
- Hendrycks, D., Dietterich, T.: "Benchmarking Neural Network Robustness to Common Corruptions and Perturbations (ImageNet-C)", ICLR 2019.






Để lại một bình luận
Bạn phải đăng nhập để gửi bình luận.