Categorical Data là gì? Phân loại dữ liệu trong phân tích và AI
10/07/2026Máy tính chỉ xử lý được các con số, nhưng phần lớn dữ liệu kinh doanh giá trị lại tồn tại dưới dạng văn bản phân nhóm như cấp bậc khách hàng, khu vực hay màu sắc. Để đưa những thông tin này vào các mô hình Machine Learning, bạn bắt buộc phải nắm vững Categorical Data là gì. Bài viết này của Viettel IDC sẽ hướng dẫn chi tiết cách phân biệt dữ liệu danh mục, kỹ thuật mã hóa chuẩn xác và giải pháp hạ tầng lưu trữ tối ưu nhất.

Categorical Data là gì?
Categorical Data, hay còn gọi là dữ liệu danh mục, là một loại dữ liệu thống kê bao gồm các biến phân loại có thể được chia thành các nhóm hoặc tập hợp hữu hạn khác nhau. Khác với dữ liệu định lượng Numerical Data biểu thị các con số có thể thực hiện các phép tính toán học như cộng trừ nhân chia, dữ liệu danh mục thường mang tính chất mô tả đặc tính, trạng thái hoặc phân loại của một đối tượng.
Ví dụ điển hình của dữ liệu danh mục bao gồm: màu sắc ô tô xanh, đỏ, đen, tình trạng hôn nhân độc thân, đã kết hôn, hoặc phương thức thanh toán tiền mặt, thẻ tín dụng, ví điện tử. Trong khi Numerical Data cho bạn biết một người cao bao nhiêu cm, thì Categorical Data sẽ phân nhóm người đó vào danh mục chiều cao như thấp, trung bình, cao.
Các loại Categorical Data phổ biến
Để xử lý chính xác, các chuyên gia khoa học dữ liệu chia dữ liệu danh mục thành ba nhóm cốt lõi dựa trên tính chất thứ bậc của chúng.
Nominal Data
Định danh Nominal là loại dữ liệu danh mục thuần túy nhất, trong đó các hạng mục hoàn toàn bình đẳng và không có bất kỳ thứ tự hay sự ưu tiên nào. Bạn không thể sắp xếp chúng từ cao xuống thấp hay từ tốt đến xấu. Ví dụ: quốc tịch Việt Nam, Nhật Bản, Mỹ hoặc loại trình duyệt web Chrome, Safari, Firefox.
Ordinal Data
Khác với Nominal, dữ liệu có thứ bậc Ordinal mang trong mình một trật tự logic tự nhiên. Mặc dù khoảng cách giữa các hạng mục không được xác định bằng một con số chính xác, nhưng chúng ta biết chắc chắn hạng mục này đứng trước hoặc lớn hơn hạng mục kia. Ví dụ: trình độ học vấn trung học, cử nhân, thạc sĩ, tiến sĩ hoặc mức độ hài lòng của khách hàng rất tệ, bình thường, rất tốt.
Binary Data
Đây là trường hợp đặc biệt của dữ liệu danh mục khi nó chỉ chứa duy nhất hai trạng thái đối lập nhau. Ví dụ: kết quả kiểm tra đạt hoặc trượt, trạng thái email spam hoặc không spam.
Bảng ví dụ thực tế Categorical Data theo ngành nghề:
Cơ chế xử lý Categorical Data trong phân tích và Machine Learning
Vì sao cần mã hóa Encoding?
Các thuật toán học máy Machine Learning và mạng nơ-ron nhân tạo bản chất là các mô hình toán học phức tạp. Chúng chỉ có thể tính toán trên các ma trận số học. Nếu bạn đưa một cột dữ liệu chứa chữ màu đỏ hoặc màu xanh vào mô hình, thuật toán sẽ báo lỗi lập tức. Do đó, bước mã hóa dữ liệu danh mục thành các định dạng số học là quy trình bắt buộc trong khâu tiền xử lý dữ liệu.
One-Hot Encoding
Đây là kỹ thuật phổ biến nhất dành cho dữ liệu Nominal. Thay vì gán mỗi hạng mục bằng một con số tự nhiên có thể gây hiểu nhầm về mặt giá trị độ lớn, One-Hot Encoding sẽ tạo ra các cột nhị phân mới cho từng hạng mục. Nếu dữ liệu gốc là màu đỏ, cột biểu diễn màu đỏ sẽ có giá trị 1, các cột màu khác sẽ nhận giá trị 0.
Label Encoding và Ordinal Encoding
Kỹ thuật này được áp dụng nghiêm ngặt cho dữ liệu Ordinal. Các hạng mục sẽ được gán bằng các số nguyên liên tiếp dựa trên thứ bậc của chúng. Ví dụ, cấp bậc thẻ thành viên Bạc, Vàng, Kim Cương sẽ được ánh xạ lần lượt thành các số 1, 2, 3. Thuật toán sẽ nhận diện được rằng mức 3 lớn hơn mức 1, giữ nguyên được bản chất logic của dữ liệu.
Rủi ro High Cardinality và sự bùng nổ chiều dữ liệu
High cardinality xảy ra khi một biến danh mục có quá nhiều giá trị duy nhất, ví dụ như cột chứa mã bưu điện hoặc tên thành phố. Nếu áp dụng One-Hot Encoding cho một cột có 1000 tên thành phố khác nhau, tập dữ liệu của bạn sẽ phình to thêm 1000 cột mới. Điều này dẫn đến hiện tượng lời nguyền của sự đa chiều Dimensionality Curse, làm mô hình học máy chạy chậm chạp, tốn tài nguyên tính toán và dễ bị học vẹt quá mức Overfitting.
Ứng dụng thực tiễn trong doanh nghiệp
Phân khúc khách hàng
Dựa vào các biến danh mục như khu vực địa lý, ngành nghề hoặc loại thiết bị sử dụng, doanh nghiệp có thể chạy các thuật toán gom cụm Clustering để tạo ra các nhóm khách hàng mục tiêu, từ đó cá nhân hóa các chiến dịch tiếp thị với độ chính xác cao.
Dự báo rời bỏ
Bằng cách phân tích các biến Binary như trạng thái gia hạn dịch vụ kết hợp với loại gói cước Nominal, hệ thống AI có thể nhận diện trước các dấu hiệu khách hàng sắp ngừng sử dụng dịch vụ để bộ phận chăm sóc khách hàng kịp thời can thiệp.
BI và Báo cáo quản trị
Các công cụ BI sử dụng Categorical Data để làm các chiều phân tích Dimensions, giúp ban lãnh đạo cắt lớp dữ liệu theo từng chi nhánh, từng loại sản phẩm hoặc trạng thái dự án, tạo ra các dashboard quản trị trực quan.
Ví dụ thực tế:
Một doanh nghiệp bán lẻ trực tuyến thu thập hàng triệu bản ghi hành vi người dùng mỗi ngày. Bằng cách mã hóa chính xác các biến Ordinal như đánh giá sao của sản phẩm từ 1 đến 5 và biến Nominal như danh mục hàng hóa, họ đã xây dựng thành công hệ thống gợi ý sản phẩm Recommendation System.
Để vận hành các mô hình AI phức tạp này, doanh nghiệp cần một nền tảng điện toán đám mây cực kỳ mạnh mẽ. Hệ sinh thái lưu trữ dữ liệu lớn Big Data và máy chủ ảo tăng tốc đồ họa Cloud GPU của Viettel IDC cung cấp năng lực tính toán vượt trội, giúp các thuật toán Deep Learning xử lý hàng tỷ ma trận dữ liệu phân loại chỉ trong tích tắc, đảm bảo hệ thống gợi ý luôn hoạt động mượt mà theo thời gian thực.

Thách thức khi xử lý Categorical Data ở quy mô doanh nghiệp
- Hiệu năng suy giảm khi Cardinality lớn: Khi dữ liệu danh mục quá đa dạng, quá trình huấn luyện mô hình sẽ tiêu tốn bộ nhớ RAM khổng lồ, đòi hỏi các kỹ thuật tối ưu hóa giảm chiều dữ liệu phức tạp như Hashing hoặc Target Encoding.
- Sai lệch mô hình do mã hóa sai bản chất: Nếu kỹ sư dữ liệu nhầm lẫn, áp dụng Label Encoding cho biến Nominal không có thứ tự ví dụ gán Hà Nội là 1, Đà Nẵng là 2, thuật toán sẽ tự hiểu lầm rằng Đà Nẵng lớn hơn gấp đôi Hà Nội, dẫn đến toàn bộ kết quả dự báo bị sai lệch nghiêm trọng.
- Yêu cầu hạ tầng xử lý ổn định: Việc luân chuyển và biến đổi hàng Terabyte dữ liệu thô thành các ma trận số hóa đòi hỏi hệ thống lưu trữ có độ trễ cực thấp và khả năng mở rộng linh hoạt.
Câu hỏi thường gặp FAQs về Categorical Data
Categorical Data khác gì Numerical Data? Categorical Data đại diện cho các nhóm, đặc tính hoặc phân loại bằng văn bản không thể tính toán toán học. Numerical Data đại diện cho số lượng hoặc kích thước thực tế có thể thực hiện phép cộng trừ nhân chia.
Làm sao biết một biến là Nominal hay Ordinal? Hãy tự hỏi các giá trị này có thể sắp xếp theo thứ tự ưu tiên từ cao xuống thấp được không. Nếu có như cấp bậc học, đó là Ordinal. Nếu chúng hoàn toàn bình đẳng như màu sắc, loại xe, đó là Nominal.
One-Hot Encoding và Label Encoding khác nhau như thế nào? One-Hot Encoding biến mỗi hạng mục thành một cột nhị phân riêng biệt để tránh tạo ra thứ bậc ảo. Label Encoding gán trực tiếp mỗi hạng mục thành một số nguyên liên tiếp trong cùng một cột.
Khi nào nên dùng One-Hot Encoding, khi nào nên dùng Label hay Ordinal Encoding? Nên dùng One-Hot Encoding cho dữ liệu Nominal không có thứ tự. Bắt buộc dùng Label hoặc Ordinal Encoding cho dữ liệu Ordinal để giữ lại bản chất thứ bậc của thông tin.
High cardinality là gì và ảnh hưởng ra sao đến mô hình? Đó là tình trạng một biến danh mục có quá nhiều giá trị khác biệt nhau ví dụ hàng ngàn mã định danh khác nhau. Nó làm bùng nổ số lượng cột dữ liệu sau khi mã hóa, gây lãng phí bộ nhớ và làm mô hình học máy hoạt động kém hiệu quả.
Categorical Data có thể chuyển thành Numerical Data không, và ngược lại? Categorical Data bắt buộc phải chuyển thành dạng số thông qua các kỹ thuật Encoding để chạy mô hình AI. Ngược lại, Numerical Data cũng có thể chuyển thành Categorical Data thông qua kỹ thuật chia thùng Binning, ví dụ biến độ tuổi cụ thể thành các nhóm tuổi như thanh niên, trung niên.
Kết luận
Hiểu rõ bản chất Categorical Data là gì và phương pháp xử lý chính xác từng nhóm dữ liệu là nền tảng cốt lõi của mọi dự án khoa học dữ liệu thành công. Việc nhận diện đúng dữ liệu Nominal hay Ordinal và áp dụng các chiến lược mã hóa thông minh không chỉ giúp bảo toàn giá trị cốt lõi của thông tin mà còn tăng độ chính xác đáng kể cho các mô hình Machine Learning.
Để được hỗ trợ tư vấn và tìm hiểu các dịch vụ của Viettel, bạn có thể liên hệ trực tiếp tới Viettel IDC qua các kênh:
- Hotline: 1800 8088 (miễn phí cước gọi)
- Fanpage: https://www.facebook.com/viettelidc
Tin nổi bật
Tin liên quan
Trigger là gì trong DBMS? Cách hoạt động, các loại phổ biến và ứng dụng
Trigger là gì trong DBMS? Tìm hiểu cách trigger hoạt động, các loại phổ biến, ví dụ minh họa, ưu nhược điểm và khi nào nên sử dụng.
Figma là gì? Nền tảng thiết kế và cộng tác trực tuyến
Figma là gì, có những tính năng nổi bật nào? Tìm hiểu Vector Network, Auto Layout, Dev Mode và vị thế hiện tại của Figma trong ngành thiết kế.
Camera Cloud cần tốc độ mạng bao nhiêu? Cách tính băng thông cần thiết
Camera Cloud cần tốc độ mạng bao nhiêu? Tìm hiểu mức băng thông cần thiết, cách tính upload và các yếu tố ảnh hưởng đến tốc độ khi sử dụng Camera Cloud.
Camera Cloud có bị hack không? Nguyên nhân và cách bảo mật
Camera Cloud có bị hack không? Tìm hiểu các rủi ro bảo mật, nguyên nhân bị xâm nhập và cách bảo vệ camera, tài khoản cùng dữ liệu hiệu quả.
Viettel IDC: Nhà cung cấp VMware Sovereign Cloud duy nhất tại Đông Nam Á
Tại VMware Explore 2026 ở Las Vegas, Broadcom đã giới thiệu nhóm 57 nhà cung cấp dịch vụ đám mây chủ quyền trên nền tảng VMware Cloud Foundation. Viettel IDC là đơn vị duy nhất tại Đông Nam Á có tên trong danh sách này, đánh dấu bước tiến mới của doanh nghiệp Việt Nam trên thị trường hạ tầng cloud khu vực.
Ghidra là gì? Chức năng và ứng dụng trong reverse engineering
Ghidra là gì? Tìm hiểu công cụ reverse engineering mã nguồn mở của NSA, các chức năng chính, ứng dụng thực tế và điểm khác biệt với IDA Pro.
10 công cụ tối ưu hóa website theo từng mục tiêu
Tổng hợp 10 công cụ tối ưu hóa web cho tốc độ, SEO, trải nghiệm người dùng và chuyển đổi, kèm bảng so sánh và gợi ý lựa chọn theo nhu cầu.
So sánh WHOIS và DNS Lookup: Điểm khác nhau và khi nào nên sử dụng
WHOIS và DNS Lookup khác nhau thế nào? Tìm hiểu định nghĩa, bảng so sánh, vai trò của RDAP thay thế WHOIS, và khi nào nên dùng công cụ nào.
Cách test tải hệ thống: Quy trình và công cụ phổ biến
Cách test tải hệ thống hiệu quả gồm những bước nào? Tìm hiểu quy trình, chỉ số cần đo và công cụ phổ biến như JMeter, k6.
Cloud Monitoring là gì? So sánh Hybrid Cloud và Multi Cloud Monitoring
Cloud Monitoring là quá trình theo dõi, quản lý và đánh giá hiệu suất của các tài nguyên và dịch vụ đám mây, bao gồm giám sát máy chủ, cơ sở dữ liệu, ứng dụng và hệ thống mạng

Bình luận ()