AI Marketing

Synthetic Data là gì? Khi nào nên dùng dữ liệu tổng hợp trong AI Marketing

Muốn thử dashboard mới mà không dám dùng danh sách khách thật? Dữ liệu tổng hợp giải quyết được việc đó. Nhưng nếu dùng nó để kết luận khách sẽ mua gì, bạn đang tự lừa mình.

ScalioCập nhật 11 phút đọc

Synthetic Data là gì? Khi nào nên dùng dữ liệu tổng hợp trong AI Marketing

Synthetic Data (dữ liệu tổng hợp) là dữ liệu được tạo ra bằng quy tắc, mô hình thống kê hoặc mô hình AI để mô phỏng cấu trúc và một số đặc điểm của dữ liệu thật, nhưng không phải là bản ghi về người hay giao dịch có thật. Một bảng 1.000 “khách hàng” với tên, khu vực, số đơn, giá trị đơn trông như thật — nhưng không ai trong đó tồn tại.

Hàng ống nghiệm chứa dung dịch nhiều màu trong phòng thí nghiệm

Trong marketing, dữ liệu tổng hợp có hai công dụng chính đáng: thử nghiệm và huấn luyện khi thiếu dữ liệu, và bảo vệ quyền riêng tư khi cần làm việc với cấu trúc dữ liệu mà không đụng tới thông tin cá nhân thật. Có một giới hạn không được vượt: dữ liệu tổng hợp không thay dữ liệu thật để ra quyết định kinh doanh hay làm bằng chứng. Nó chỉ phản ánh những giả định người tạo đã đưa vào.

Các dạng dữ liệu tổng hợp thường gặp

DạngCách tạoHợp với
Dữ liệu giả theo quy tắcSinh ngẫu nhiên theo định dạng: tên, số điện thoại, ngày, số tiền trong khoảng cho trướcThử form, thử báo cáo, thử quy trình nhập liệu
Mô phỏng theo thống kêDựa trên phân phối của dữ liệu thật (tỷ lệ, trung bình, tương quan) để sinh bản ghi mớiChia sẻ cấu trúc dữ liệu cho đối tác, thử mô hình
Sinh bằng mô hình AIMô hình học từ dữ liệu thật rồi tạo bản ghi hoặc văn bản mớiBổ sung ví dụ hiếm để huấn luyện bộ phân loại
Tổng hợp một phầnGiữ dữ liệu thật, thay các trường nhạy cảm bằng giá trị tạo raMôi trường thử nghiệm gần với thực tế

Cần phân biệt với hai thứ hay bị gọi nhầm là “synthetic”: ẩn danh hóa (xóa hoặc che trường định danh trên dữ liệu thật — vẫn là dữ liệu thật) và “khách hàng ảo” do AI nhập vai để trả lời khảo sát. Loại thứ hai là văn bản AI viết theo mô tả bạn cung cấp; nó có thể giúp nghĩ ra câu hỏi, không cho biết khách thật nghĩ gì.

Khi nào nên và không nên dùng

Nên dùngKhông nên dùng
Kiểm thử dashboard, báo cáo trước khi có dữ liệu thậtKết luận nhóm khách nào sẽ mua nhiều hơn
Tạo trường hợp biên để thử quy trình (thiếu trường, trùng, dấu tiếng Việt lỗi)Làm số liệu trong báo cáo gửi sếp, nhà đầu tư, khách hàng
Bổ sung ví dụ hiếm khi huấn luyện, thử mô hình phân loạiThay khảo sát hay phỏng vấn khách thật
Gửi cấu trúc dữ liệu cho bên làm kỹ thuật mà không lộ thông tin cá nhânChứng minh một chiến dịch hiệu quả
Demo, đào tạo nhân viên dùng hệ thốngTrích dẫn như nghiên cứu thị trường

Cần chuẩn bị gì

  • Một câu hỏi thử nghiệm cụ thể: thử cái gì, thế nào là đạt.
  • Lược đồ dữ liệu: danh sách trường, kiểu dữ liệu, khoảng giá trị hợp lệ, quan hệ giữa các trường.
  • Mô tả thống kê của dữ liệu thật nếu cần mô phỏng sát — ở dạng tổng hợp (tỷ lệ, phân phối), không phải bản ghi cá nhân.
  • Quy định nhãn: mọi tệp tổng hợp phải ghi rõ là dữ liệu tổng hợp trong tên tệp và trong nội dung, để không bị trộn vào dữ liệu thật. Quy định này nên nằm trong khung quản trị dữ liệu.

Quy trình dùng dữ liệu tổng hợp 6 bước

Bước 1. Xác định mục đích thử nghiệm

Viết rõ: “Dùng dữ liệu tổng hợp để kiểm tra [hệ thống/quy trình] xử lý đúng [tình huống].” Ví dụ: kiểm tra báo cáo doanh thu theo chi nhánh hiển thị đúng khi một chi nhánh không có đơn nào trong tuần. Mục đích quyết định mức độ giống thật cần có — thử giao diện chỉ cần dữ liệu đúng định dạng; thử mô hình phân loại cần mô phỏng sát phân phối hơn.

Bước 2. Chọn thuộc tính cần bảo toàn

Không thể và không cần giữ mọi đặc điểm của dữ liệu thật. Chọn những gì quan trọng cho mục đích: tỷ lệ khách theo khu vực, khoảng giá trị đơn, mối liên hệ giữa số lần mua và giá trị đơn, tỷ lệ bản ghi thiếu số điện thoại. Ghi lại danh sách này — nó chính là giới hạn của những gì dữ liệu tổng hợp có thể “nói”.

Bước 3. Tạo dữ liệu không sao chép cá nhân

Dữ liệu tổng hợp vẫn có thể làm lộ thông tin nếu mô hình “nhớ” và sinh lại gần như nguyên văn bản ghi thật, nhất là với các bản ghi hiếm (một khách duy nhất ở một huyện, mua một món rất đắt). Sau khi tạo, kiểm tra xem có bản ghi nào trùng hoặc quá giống bản ghi thật không; với dữ liệu có liên quan đến cá nhân, vẫn cần thận trọng theo Nghị định 13/2023/NĐ-CP về bảo vệ dữ liệu cá nhân khi đưa dữ liệu thật vào quá trình tạo. Nếu chỉ cần thử định dạng, dùng dữ liệu giả theo quy tắc là an toàn nhất vì không học từ ai cả.

Bước 4. So sánh phân phối với dữ liệu thật

Với dữ liệu mô phỏng, đặt cạnh nhau các chỉ số tổng hợp của hai tập: tỷ lệ theo nhóm, trung bình, khoảng giá trị, tỷ lệ trống. Lệch lớn ở thuộc tính đã chọn bảo toàn nghĩa là bộ tạo chưa đạt. Nhưng khớp phân phối không có nghĩa là khớp hành vi — đó là lý do có bước 6.

Bước 5. Kiểm tra thiên lệch

Dữ liệu tổng hợp thừa hưởng thiên lệch của dữ liệu gốc và của giả định người tạo, đôi khi còn khuếch đại lên. Nếu dữ liệu gốc gần như toàn khách ở thành phố lớn, dữ liệu tổng hợp sẽ “quên” khách tỉnh; nếu bạn nhờ AI tạo khách hàng theo mô tả rập khuôn, kết quả sẽ rập khuôn. Xem phân bố theo nhóm, tìm nhóm bị thiếu hoặc bị phóng đại. Khung quản lý rủi ro AI của NIST là tài liệu tham khảo tốt về cách nhìn thiên lệch như một rủi ro cần quản lý.

Bước 6. Không dùng thay bằng chứng thị trường

Đặt quy tắc thành văn bản: kết quả chạy trên dữ liệu tổng hợp chỉ dùng để xác nhận hệ thống, quy trình hoạt động đúng. Mọi câu hỏi “khách sẽ phản ứng thế nào” phải trả lời bằng dữ liệu thật — thử nghiệm quảng cáo thật (xem creative testing), khảo sát khách thật, số bán thật. Trong báo cáo, không trộn biểu đồ từ dữ liệu tổng hợp với biểu đồ từ dữ liệu thật.

Ví dụ thực hành: trung tâm tiếng Anh thử dashboard tuyển sinh

Ví dụ giả định: một trung tâm tiếng Anh chuẩn bị đưa vào dùng một dashboard marketing theo dõi lượt đăng ký học thử theo kênh và theo khóa. Dữ liệu thật có thông tin phụ huynh và học viên nhỏ tuổi, nên họ không muốn dùng để thử.

ViệcCách làm
Tạo dữ liệuSinh 1.000 lượt đăng ký giả theo quy tắc: kênh, khóa, ngày, trạng thái; không dùng tên hay số điện thoại thật
Trường hợp biênThêm bản ghi thiếu kênh, ngày trong tương lai, cùng một phụ huynh đăng ký hai khóa, tên có dấu bị lỗi mã hóa
Kiểm traDashboard có đếm trùng không, bộ lọc ngày có đúng không, kênh trống hiển thị ra sao
Kết luận đúngDashboard xử lý đúng các trường hợp biên, sẵn sàng nối dữ liệu thật
Kết luận saiKênh Facebook mang về nhiều học viên nhất — con số đó chỉ phản ánh tỷ lệ người tạo đặt vào
Ví dụ giả định — minh hoạ cách ra quyết định, không phải kết quả đã được xác nhận

AI giúp được gì với dữ liệu tổng hợp

AI hữu ích trong việc liệt kê trường hợp biên bạn chưa nghĩ tới, viết nháp mô tả lược đồ, sinh văn bản mẫu (bình luận, tin nhắn giả) để thử bộ phân loại chủ đề. Nhưng văn bản do mô hình ngôn ngữ sinh ra mang giọng và giả định của chính mô hình — không thay được bình luận thật của khách, và có thể chứa chi tiết tưởng như dữ kiện nhưng là bịa, như bài AI hallucination trong marketing đã nói. Đừng dán dữ liệu khách hàng thật vào công cụ AI không được phê duyệt chỉ để nhờ “tạo dữ liệu giống thế này”.

Sai lầm thường gặp

  • Dùng kết quả trên dữ liệu tổng hợp để ra quyết định ngân sách, định giá, chọn thông điệp.
  • Không gắn nhãn, sau vài tuần tệp tổng hợp lẫn vào thư mục dữ liệu thật.
  • Coi dữ liệu tổng hợp là tự động an toàn trong khi mô hình có thể sinh lại bản ghi gần giống người thật.
  • Cho AI nhập vai khách hàng rồi trích câu trả lời như ý kiến khách.
  • Bỏ qua kiểm tra thiên lệch, khiến mô hình thử nghiệm học lệch ngay từ đầu.

Câu hỏi thường gặp

Dữ liệu tổng hợp có phải là dữ liệu cá nhân không?

Dữ liệu tổng hợp được tạo tốt không mô tả người thật, nhưng quá trình tạo có thể dùng dữ liệu cá nhân thật, và mô hình có thể sinh lại bản ghi gần giống người thật. Vì vậy vẫn cần kiểm soát đầu vào, kiểm tra đầu ra và thận trọng theo quy định về bảo vệ dữ liệu cá nhân.

Có thể dùng AI tạo “khách hàng ảo” để thay khảo sát không?

Không nên. Câu trả lời của khách hàng ảo phản ánh mô tả bạn đưa vào và giả định của mô hình, không phải ý kiến của khách thật. Có thể dùng để thử bảng câu hỏi hay nghĩ thêm câu hỏi, còn kết luận phải dựa trên khảo sát và hành vi thật.

Doanh nghiệp nhỏ có cần dữ liệu tổng hợp không?

Thường chỉ cần ở dạng đơn giản: một bảng dữ liệu giả để thử báo cáo, form hay quy trình trước khi dùng dữ liệu thật, hoặc để đào tạo nhân viên mà không lộ thông tin khách. Các kỹ thuật mô phỏng phức tạp chủ yếu cần khi có đội dữ liệu và bài toán huấn luyện mô hình.

Đưa thông tin thật về doanh nghiệp vào Brand Brain để AI viết dựa trên dữ kiện, không dựa trên giả định.

Điền hồ sơ thương hiệu một lần: Scalio lập chiến lược, viết bài theo đúng giọng của bạn, xếp lịch đăng và chấm điểm marketing.

Tạo tài khoản miễn phí

Bài viết liên quan