Vì sao khâu chuẩn bị quyết định chất lượng đầu ra
Có một câu trong giới dữ liệu: "rác vào, rác ra". Với AI synthesis điều này càng đúng. Nếu bạn dán một cục transcript lộn xộn, không phân biệt được ai đang nói, lẫn tiếng ồn gỡ băng sai, thì AI sẽ tổng hợp trên nền dữ liệu nhiễu và cho ra insight đáng ngờ. Ngược lại, 20 phút chuẩn bị dữ liệu sạch sẽ tiết kiệm cho bạn hàng giờ sửa lỗi về sau.
Khâu chuẩn bị gồm ba việc: gỡ băng, ẩn danh, chuẩn hóa định dạng.
1. Gỡ băng (transcribe)
Dùng công cụ gỡ băng tự động (nhiều công cụ hỗ trợ tiếng Việt) để chuyển ghi âm thành text. Sau khi có bản thô, bạn nhờ AI dọn dẹp:
Đây là transcript gỡ băng tự động từ một buổi phỏng vấn tiếng Việt,
có thể có lỗi nhận dạng và câu bị đứt.Hãy dọn lại cho dễ đọc:
- Sửa lỗi chính tả/nhận dạng rõ ràng (VD "gio hang" -> "giỏ hàng").
- Gắn nhãn người nói: [PV] cho người phỏng vấn, [ND] cho người dùng.
- Giữ NGUYÊN nội dung và cách nói của người dùng, KHÔNG diễn giải lại,
KHÔNG tóm tắt, KHÔNG thêm ý.
- Nếu một đoạn nghe không rõ, giữ nguyên và đánh dấu [không rõ].
TRANSCRIPT THÔ:
[dán vào đây]
Lưu ý: yêu cầu "giữ nguyên nội dung" là chốt chặn để AI không tự ý viết lại lời người dùng thành câu "đẹp" hơn nhưng sai nghĩa.
2. Ẩn danh (anonymize)
Đây là bước bắt buộc về mặt đạo đức và pháp lý. Trước khi đưa bất kỳ dữ liệu nào lên công cụ AI, loại bỏ thông tin nhận dạng cá nhân (PII): họ tên đầy đủ, email, số điện thoại, tên công ty cụ thể, địa chỉ.
Cách làm an toàn nhất là ẩn danh trước khi đưa lên AI, thay vì nhờ AI làm việc đó (vì để nhờ, bạn đã phải gửi PII lên rồi). Quy ước thay thế:
- Người dùng thật → "ND-01", "ND-02"...
- Công ty họ nhắc → "[công ty A]"
- Sản phẩm đối thủ → giữ nếu cần phân tích, nhưng cân nhắc chính sách.
3. Chuẩn hóa định dạng
Mỗi buổi phỏng vấn nên là một file/khối text có cấu trúc thống nhất:
=== BUỔI PHỎNG VẤN ===
Mã: PV-2026-03-ND07
Bối cảnh: PM tại startup fintech, dùng sản phẩm 3 tháng
Chủ đề: trải nghiệm onboarding[PV] Câu hỏi...
[ND-07] Trả lời...
Định dạng thống nhất giúp AI dễ trích quote kèm mã nguồn ở các bước sau — đây chính là nền tảng để chống bịa insight.
Các bước chuẩn bị
- Xuất tất cả ghi âm ra một thư mục, đặt tên theo mã buổi.
- Gỡ băng từng file bằng công cụ tự động.
- Chạy prompt dọn transcript để gắn nhãn người nói.
- Ẩn danh PII bằng find-and-replace thủ công.
- Bọc mỗi buổi bằng header chuẩn (mã, bối cảnh, chủ đề).
- Đọc lướt một buổi để chắc chắn AI không tự ý viết lại nội dung.
Template header buổi phỏng vấn (tái dùng)
Mã buổi: [PV-năm-tháng-mã người dùng]
Ngày:
Người dùng (ẩn danh): ND-xx
Bối cảnh: [vai trò, ngành, thời gian dùng sản phẩm]
Mục tiêu research: [1 câu]
Câu hỏi nghiên cứu chính: [1–2 câu]
---
[nội dung transcript đã gắn nhãn]
Sai lầm thường gặp
- Bỏ qua ẩn danh vì "vội": đây là rủi ro rò rỉ dữ liệu nghiêm trọng nhất. Một transcript có tên thật + phàn nàn về sếp của người dùng, nếu lộ, có thể gây hại thật cho họ. Ẩn danh không bao giờ là bước bỏ được.
- Để AI "làm đẹp" lời người dùng: nếu AI viết lại "tôi thấy rối quá" thành "trải nghiệm chưa tối ưu", bạn đã mất đúng cái giọng cảm xúc mình cần. Sắc thái cảm xúc là dữ liệu.
- Không gắn mã nguồn: nếu transcript không có mã, sau này bạn không thể truy quote về buổi nào — mở đường cho ảo giác của AI đi lọt.
- Tin bản gỡ băng tự động 100%: công cụ gỡ băng sai từ khóa quan trọng (tên tính năng, thuật ngữ) rất thường xuyên. Luôn soát các đoạn mấu chốt bằng tai.