
Mastering Data Analytics (MDA)
+250.000 người theo dõi chúng tôi trên các nền tảng. Hãy để lại email để cập nhập kiến thức mới nhất về Data Analytics với No-code, AI & Automation! 👇
Share this page
Trước khi cho AI đọc dữ liệu, hãy chắc rằng công ty bạn đã định nghĩa dữ liệu ĐÚNG

LÊ THỊ PHƯƠNG THẢO
lúc 11:19:41 4 tháng 9, 2026

Bạn có dám chắc "khách hàng active" trong file của công ty mình nghĩa là gì và ba người khác nhau trả lời có trùng nhau không?
Công ty nào cũng có một file mà ai cũng gật đầu là nên có, rồi không ai chịu ngồi viết: cái file ghi rõ mỗi cột dữ liệu nghĩa là gì.
Người mới vào mở bảng bán hàng, thấy cột "khách hàng active", hỏi cột này tính sao. Người ngồi cạnh đoán một kiểu, chị kế toán nhớ một kiểu, anh làm báo cáo bảo để mở file cũ ra coi lại. Không câu nào sai hẳn, cũng không câu nào chắc.
Cái file đó tên là data dictionary (từ điển dữ liệu): danh mục các bảng và cột, mỗi cột ghi định nghĩa nghiệp vụ, kiểu dữ liệu, nguồn lấy về, quy tắc tính. Nó là chỗ cả công ty thống nhất một chữ trên báo cáo nghĩa là gì.
▸ ▸ ▸
🔸VÌ SAO NÓ LUÔN ĐƯỢC VIẾT SAI CÁCH
Chuyện này ít liên quan tới sự lười. Có một cơ chế đứng sau.
Xưa nay người đọc từ điển dữ liệu là người, mà người thì đọc lướt. Gặp một định nghĩa hơi kỳ, họ tự chỉnh lại trong đầu bằng kinh nghiệm rồi đi tiếp. Một dòng viết ẩu vẫn xài được.
Nghĩa là viết sai gần như chẳng bao giờ bị lộ, mà cái gì không lộ thì không ai sửa. Chuẩn viết cứ thế trôi xuống mức thấp nhất còn dùng được: chép cho đủ dòng.
Thêm nữa, phần thưởng của việc viết định nghĩa nằm ở sáu tháng sau, còn deadline báo cáo nằm ở chiều nay. Phần thưởng xếp chỗ nào thì sự chú ý chạy về chỗ đó.
Hồi đó viết vẫn có ích, người mới vào việc nhanh hơn, câu hỏi lặp lại giảm hẳn. Chỉ là giá trị ấy khó thấy nên luôn thua việc gấp.
▸ ▸ ▸
🔸GIỜ THÌ VIỆC CỦA CÁI FILE ĐÃ ĐỔI
Khi bạn cắm một AI Agent (trợ lý AI làm được nhiều bước thay bạn) vào kho dữ liệu để hỏi bằng tiếng Việt, thứ nó dựa vào để hiểu "khách hàng active" nghĩa là gì chính là phần mô tả bạn viết. Nó đọc nguyên văn, không đoán ý bạn định nói. Chỗ này ai cũng đoán ra.
Cái ít người để ý nằm chỗ khác. Từ ngày có một người đọc nguyên văn, một dòng sai đắt hơn hẳn một dòng để trống.
Dòng để trống thì im. Bạn hỏi, AI báo không đủ căn cứ hoặc hỏi ngược lại bạn. Bực mình, nhưng bạn biết mình đang thiếu gì.
Dòng sai thì lên tiếng. Bạn hỏi tháng này có bao nhiêu khách active. Trong file, ai đó từng gõ cho nhanh "khách đã từng mua hàng", trong khi cả công ty vẫn ngầm hiểu active là có đơn trong 90 ngày gần nhất. Con số trả về phình lên gấp mấy lần, nhưng vẫn đẹp, vẫn đúng định dạng, đặt cạnh các số khác chẳng có gì gợn. Nó đi vào báo cáo tuần, rồi thành cơ sở cho một kế hoạch chăm sóc khách hàng.
Chỗ khó nhất nằm ở đây: người ngồi hỏi thường chính là người không nắm định nghĩa. Không nắm nên m ới phải hỏi. Vậy trong cả chuỗi đó, chẳng ai đứng ở vị trí bắt được lỗi. Cái sai không nằm im, nó còn được trích lại ở lần sau.
Cột nghe hiền nhất lại hay dính nhất. "Hoàn thành" ở cột trạng thái đơn là đã giao xong hay đã thu được tiền?
▸ ▸ ▸
🔸CÓ FILE RỒI MÀ VẪN CÃI NHAU THÌ SAO
Chắc có bạn nhớ chuyện mình nói mấy hôm trước: nhiều nơi đã có sẵn file từ điển chỉ số mà các phòng vẫn cãi nhau y như cũ. Vậy viết thêm làm gì.
Hai chuyện đó là hai vế của cùng một việc.
Vế thứ nhất là quyền sở hữu: định nghĩa không có người đứng tên thì chẳng ai giữ cho nó đúng, file có cũng như không.
Vế thứ hai là thứ mình nói hôm nay: kể cả khi đã có người đứng tên, chuẩn viết ngày xưa vẫn chưa đủ, vì người đọc mới không biết đọc lướt và không biết bỏ qua chỗ vô lý.
Có chủ thì file được giữ cho đúng. Còn thứ quyết định đúng hay sai bây giờ là từng dòng một.
▸ ▸ ▸
🔸VIẾT SAO CHO LÂU DÀI
Bắt đầu từ 20 cột được dùng nhiều nhất. Nghe như mẹo cho đỡ nản, thật ra đây là lựa chọn đúng về bản chất. Thứ đắt giá ở từ điển dữ liệu không phải độ phủ, mà là độ đúng. 20 cột đúng thắng 200 cột chép cho có, vì 180 dòng chép cho có kia là một nguồn sai có hệ thống mà chẳng ai bắt được.
Mỗi tuần thêm vài cột, và gắn nó vào quy trình: cột mới sinh ra thì phải kèm định nghĩa, coi như một bước bắt buộc của việc tạo cột, giống như xuất hàng xong phải lưu chứng từ. Trông vào quyết tâm thì thua, vì quyết tâm luôn phải cạnh tranh với việc gấp.
Vài thứ nhỏ mà đổi kết quả nhiều: đặt tên cột theo nghĩa nghiệp vụ (Total Revenue dễ hiểu hơn Sum_Rev_YTD, cho người lẫn cho máy), ẩn bớt cột kỹ thuật kiểu mã ID, ghi rõ công thức tính và nguồn của từng chỉ số.
Rồi giữ một chốt cuối: dòng nào cũng phải có người xác nhận là đúng, số nào quan trọng thì vẫn phải có người đọc lại trước khi ra quyết định. AI đề xuất, người kiểm và chịu trách nhiệm phần này không giao lại được.
▸ ▸ ▸
Mô tả dữ liệu là việc buồn tẻ, làm xong không ai vỗ tay. Nhưng mỗi dòng bạn viết hôm nay sẽ được đọc lại nguyên văn hàng trăm lần trong những câu trả lời sắp tới.
Nên câu đáng hỏi là: trong đám dòng đang có, bao nhiêu dòng bạn dám ký tên vào?
Bạn thử chọn đại một cột trong file bán hàng rồi hỏi hai người xem cột đó tính thế nào nhé. Có trùng khớp không?
Cách dựng không gian dữ liệu cho AI đọc được, từ đặt tên tới tầng ngữ nghĩa, bên mình có dạy trong chương trình Agentic AI Analytics.
Tìm hiểu về chương trình bạn sẽ học được kiến thức thật sự nền tảng & ứng dụng thực tế cao, không chỉ kiến thức bề mặt!
-----
🔔+240.000 người đăng ký theo dõi chúng tôi trên các nền tảng: https://www.mastering-da.com/newsletter
📌Các chương trình ANALYTICS ứng dụng vào AGENTIC AI - phiên bản NÂNG CẤP mới nhất 2026, kế thừa nền tảng đào tạo Analytics hàng đầu Việt Nam từ 2020, tập trung vào tư duy phân tích, năng lực ra quyết định và ứng dụng AI trong thực tế doanh nghiệp
→ Agentic AI Analytics (BI) dành cho mọi phòng ban làm việc với dữ liệu: https://www.mastering-da.com/agentic-ai-anlytics-program
→ Finance Analytics Agent Skills (FA) dành cho tài chính, kế hoạch, quản trị: https://www.mastering-da.com/finance-analytics-program
#PhuongThaoAnalytics #AI #Analytics #DataDriven #AgenticAI #MasteringDataAnalytics
Until next time, keep turning data into decisions!



