Pilot test bảng hỏi: cỡ mẫu khảo sát thử, quy trình 3 bước và checklist
Pilot test là lần chạy thử bảng hỏi với chuyên gia và người thật để sửa lỗi trước khi phát hàng trăm phiếu. Bài này hướng dẫn từng giai đoạn, cỡ mẫu cần thiết và cách đọc kết quả.
Tóm tắt nhanh
- Pilot test gồm 3 giai đoạn: đánh giá chuyên gia (CVI), phỏng vấn nhận thức 5–15 người, và khảo sát thử định lượng quy mô nhỏ.
- CVI: ít nhất 3 chuyên gia; với tối đa 5 chuyên gia I-CVI phải bằng 1,00, với 6–10 chuyên gia I-CVI ≥ 0,78; S-CVI/Ave ≥ 0,90.
- Khảo sát thử: ít nhất 30 người thuộc tổng thể mục tiêu khi phát triển thang đo (Johanson & Brooks, 2010).
- Đọc thời gian hoàn thành, tỷ lệ bỏ dở, câu bị bỏ trống, hiệu ứng sàn/trần trên 15% và câu gần như không có phương sai; Cronbach's Alpha chỉ mang tính sơ bộ.
- Diễn tập quy trình dữ liệu bằng phản hồi thử chỉ để bắt lỗi kỹ thuật, không thay thế người trả lời thật và không bao giờ được báo cáo như dữ liệu.
Pilot test bảng hỏi kiểm tra những gì
Pilot test (khảo sát thử) là bước chạy bảng hỏi ở quy mô nhỏ trước khi thu dữ liệu chính thức. Mục tiêu không phải để có kết quả nghiên cứu mà để phát hiện lỗi khi việc sửa còn rẻ. Dillman & cộng sự (2014) khuyến nghị kết hợp nhiều hình thức kiểm tra trước, vì mỗi hình thức bắt được một loại lỗi khác nhau. Một pilot tốt trả lời được sáu câu hỏi:
- Từ ngữ: người trả lời có hiểu câu hỏi đúng như bạn định hỏi không?
- Thời lượng: mất bao lâu để hoàn thành, có quá dài không?
- Trình tự: thứ tự câu hỏi có gây mệt mỏi hoặc dẫn dắt câu trả lời không?
- Rẽ nhánh: mỗi nhóm đối tượng có đi đúng phần câu hỏi dành cho mình không?
- Đường ống dữ liệu: dữ liệu từ Google Form sang Sheet, sang SPSS có đúng định dạng không?
- Tính khả thi: tiếp cận được đối tượng không, tỷ lệ phiếu hợp lệ khoảng bao nhiêu?
Trong luận văn ở Việt Nam
Nguyễn Đình Thọ (2011) mô tả quy trình gồm nghiên cứu sơ bộ và nghiên cứu chính thức. Nghiên cứu sơ bộ thường có hai phần: nghiên cứu sơ bộ định tính (thảo luận với chuyên gia, phỏng vấn sâu để điều chỉnh thang đo) và nghiên cứu định lượng sơ bộ (khảo sát mẫu nhỏ để đánh giá sơ bộ thang đo). Ba giai đoạn dưới đây khớp với cách chia này: giai đoạn 1 và 2 thuộc phần định tính, giai đoạn 3 là định lượng sơ bộ.
Giai đoạn 1: đánh giá chuyên gia và chỉ số CVI
Mời các chuyên gia (giảng viên, người làm nghề trong lĩnh vực) chấm mức độ phù hợp của từng câu với khái niệm cần đo trên thang 4 điểm: 1 = không phù hợp, 2 = cần sửa nhiều, 3 = phù hợp nhưng cần sửa nhỏ, 4 = rất phù hợp. Từ đó tính chỉ số giá trị nội dung (content validity index, CVI):
- I-CVI của một câu = số chuyên gia chấm 3 hoặc 4 / tổng số chuyên gia.
- S-CVI/Ave của cả thang đo = trung bình các I-CVI.
Theo Lynn (1986), cần ít nhất 3 chuyên gia; nếu có từ 5 chuyên gia trở xuống thì I-CVI phải bằng 1,00, với 6–10 chuyên gia thì I-CVI không thấp hơn 0,78. Polit & Beck (2006) đề nghị S-CVI/Ave từ 0,90 trở lên và nhấn mạnh phải báo cáo rõ đã dùng cách tính nào.
| Câu | Điểm của 6 chuyên gia | Số người chấm 3–4 | I-CVI | Kết luận |
|---|---|---|---|---|
| Q1 | 4, 4, 3, 4, 3, 4 | 6 | 1,00 | Giữ |
| Q2 | 4, 3, 3, 4, 4, 3 | 6 | 1,00 | Giữ |
| Q3 | 4, 4, 2, 3, 4, 3 | 5 | 0,83 | Giữ, xem góp ý |
| Q4 | 3, 2, 4, 2, 3, 4 | 4 | 0,67 | Sửa hoặc thay |
| Q5 | 4, 4, 4, 3, 4, 4 | 6 | 1,00 | Giữ |
S-CVI/Ave = (1,00 + 1,00 + 0,83 + 0,67 + 1,00) / 5 = 0,90 (tính bằng phân số chính xác là 4,5 / 5). Thang đo vừa đạt ngưỡng chung, nhưng Q4 vẫn dưới 0,78 và phải sửa. Đừng để chỉ số trung bình che đi một câu yếu.
Giai đoạn 2: phỏng vấn nhận thức
Phỏng vấn nhận thức (cognitive interview) cho biết người trả lời nghĩ gì khi đọc câu hỏi. Willis (2005) mô tả hai kỹ thuật chính, thường được thực hiện theo vòng với khoảng 5–15 người, sửa bảng hỏi giữa các vòng:
- Nói to suy nghĩ (think-aloud): người tham gia vừa trả lời vừa nói ra những gì đang nghĩ.
- Hỏi thăm dò (verbal probing): người phỏng vấn đặt câu hỏi phụ sau từng câu hoặc cuối bảng hỏi.
Một số câu thăm dò mẫu:
- "Bạn hiểu cụm từ 'trải nghiệm số' trong câu này là gì?"
- "Bạn có thể nói lại câu hỏi này bằng lời của mình không?"
- "Vì sao bạn chọn mức 4 mà không phải mức 5?"
- "Có lựa chọn nào bạn muốn chọn nhưng không có không?"
- "Câu nào khiến bạn phải đọc lại hoặc thấy khó trả lời thật lòng?"
Chọn người tham gia đúng đối tượng khảo sát, không phải bạn cùng nhóm nghiên cứu. Ghi lại từng vấn đề theo mã câu để đưa vào nhật ký chỉnh sửa.
Diễn tập quy trình dữ liệu trước khi khảo sát thử
Trước khi gửi form cho người thật, hãy chắc chắn hệ thống kỹ thuật chạy đúng. Lỗi rẽ nhánh hay lỗi mã hóa phát hiện sau khi đã có 30 người trả lời sẽ làm hỏng cả vòng pilot.
- Đi hết mọi nhánh: dùng chế độ Xem trước (Preview) và gửi phản hồi thử cho từng lựa chọn có thiết lập "Chuyển đến phần dựa trên câu trả lời (Go to section based on answer)". Cách thiết lập xem tại bài tạo Google Form khảo sát chuẩn.
- Kiểm tra Sheet xuất ra: thứ tự cột, câu hộp kiểm (Checkboxes) gộp nhiều đáp án trong một ô, câu lưới trắc nghiệm (Multiple choice grid) xuất nhãn chữ thay vì số.
- Kiểm tra mã hóa SPSS: chạy thử cú pháp mã hóa, đảo chiều câu nghịch, gán nhãn giá trị. Lỗi kinh điển là dùng
Transform → Automatic Recode, công cụ này đánh số theo thứ tự chữ cái nên "Đồng ý" có thể nhận mã nhỏ hơn "Hoàn toàn không đồng ý". Quy trình chi tiết ở bài xuất dữ liệu Google Form sang SPSS. - Chạy thử script phân tích đến bước cuối để chắc mọi biến đều có mặt.
Khi cần gửi nhiều phản hồi thử qua tất cả các nhánh, Google Form Auto Filler của AutoFillForm có thể đọc cấu trúc form và gửi phản hồi theo cấu hình. Để diễn tập phần phân tích, module nghiên cứu SPSS sinh dữ liệu Likert mô phỏng và xuất cú pháp .sps.
Giai đoạn 3: khảo sát thử định lượng
Cỡ mẫu khảo sát thử
Johanson & Brooks (2010) khuyến nghị ít nhất 30 người thuộc tổng thể mục tiêu cho giai đoạn phát triển thang đo ban đầu. Hertzog (2008) cho thấy cỡ mẫu pilot hợp lý dao động khoảng 10–40 người mỗi nhóm tùy mục đích: kiểm tra tính khả thi cần ít hơn, ước lượng tham số cần nhiều hơn. Pilot không dùng để kiểm định giả thuyết, nên đừng tính power cho nó. Cỡ mẫu chính thức xem tại bài cách tính cỡ mẫu.
Các chỉ số cần đọc
| Chỉ số | Cách đo | Dấu hiệu cần xem lại |
|---|---|---|
| Thời gian hoàn thành | Trung vị (median), vì vài người để form mở rất lâu làm trung bình bị lệch | Vượt xa thời lượng bạn ghi trong lời mời |
| Bỏ dở theo phần | Số người dừng ở mỗi phần | Một phần có số người dừng tăng đột biến |
| Câu bị bỏ trống | Tỷ lệ trống ở câu không bắt buộc | Một câu bị bỏ trống nhiều hơn hẳn các câu khác |
| Hiệu ứng sàn/trần | Tỷ lệ người đạt điểm thấp nhất hoặc cao nhất có thể | Trên 15% người trả lời (Terwee & cộng sự, 2007) |
| Phương sai câu hỏi | Độ lệch chuẩn, phân bố tần số | Gần như ai cũng chọn cùng một mức |
| Cronbach's Alpha sơ bộ | Alpha và tương quan biến–tổng | Tương quan âm, thường do quên đảo chiều câu nghịch |
Google Form chỉ lưu phản hồi đã gửi và dấu thời gian lúc gửi, không lưu lúc bắt đầu hay phiếu bỏ dở. Vì vậy thời gian và tỷ lệ bỏ dở nên đo bằng cách quan sát trực tiếp một phần người tham gia, nhờ họ ghi giờ bắt đầu, hoặc so số lời mời với số phiếu nhận được. Muốn thấy câu bị bỏ trống, đừng đặt tất cả câu ở chế độ Bắt buộc (Required) trong vòng pilot.
Ngưỡng 15% của Terwee & cộng sự (2007) được đề xuất cho điểm tổng của thang đo; với từng câu Likert, hãy dùng như tín hiệu để xem lại chứ không phải tiêu chí loại câu. Cronbach's Alpha ở n = 30 dao động mạnh giữa các mẫu, nên đừng xóa câu chỉ để nâng alpha của pilot. Cách đọc đầy đủ có tại bài Cronbach's Alpha trong SPSS.
Câu hỏi phản hồi cuối bảng hỏi
Thêm một câu Đoạn (Paragraph) không bắt buộc ở cuối form pilot: "Có câu nào khó hiểu, khó trả lời hoặc thiếu lựa chọn phù hợp không? Vui lòng ghi số câu và lý do." Câu này thường chỉ ra đúng chỗ mà các chỉ số định lượng chỉ gợi ý.
Nhật ký chỉnh sửa và chuyện gộp dữ liệu pilot
Mọi thay đổi sau pilot nên được ghi vào nhật ký chỉnh sửa, vì hội đồng thường hỏi "thang đo đã điều chỉnh thế nào so với bản gốc".
| Mã câu | Vấn đề | Bằng chứng | Chỉnh sửa | Phiên bản |
|---|---|---|---|---|
| Q4 | Chuyên gia cho là đo hai ý trong một câu | I-CVI = 0,67 | Tách thành Q4a, Q4b | v2 |
| Q12 | Người trả lời hiểu "nền tảng số" khác nhau | 3/8 người trong phỏng vấn nhận thức | Thêm ví dụ trong ngoặc | v2 |
Có được gộp dữ liệu pilot vào mẫu chính thức không?
Nhìn chung là không nếu bảng hỏi đã thay đổi, dù chỉ là từ ngữ, vì hai nhóm đã trả lời hai công cụ đo khác nhau. Ngay cả khi không sửa gì, cách an toàn nhất vẫn là tách riêng dữ liệu pilot và báo cáo rõ. Cũng nên loại người đã tham gia pilot khỏi đợt chính thức để tránh việc họ trả lời theo trí nhớ.
Checklist pilot test bảng hỏi
- Đã có ít nhất 3 chuyên gia chấm điểm; mọi câu đạt ngưỡng I-CVI và S-CVI/Ave ≥ 0,90.
- Đã phỏng vấn nhận thức 5–15 người đúng đối tượng, sửa câu và chạy lại vòng nếu cần.
- Đã đi thử mọi nhánh rẽ, kiểm tra Sheet, cú pháp mã hóa SPSS và script phân tích.
- Đã xóa toàn bộ phản hồi thử và tạo Sheet mới trước khi mở form cho người thật.
- Đã khảo sát thử với ít nhất 30 người thuộc tổng thể mục tiêu.
- Đã đọc thời gian hoàn thành, bỏ dở, câu bị bỏ trống, sàn/trần, phương sai và alpha sơ bộ.
- Đã ghi nhật ký chỉnh sửa và đánh số phiên bản bảng hỏi.
- Đã quyết định và ghi rõ dữ liệu pilot được tách riêng.
- Đã ước tính tỷ lệ phiếu hợp lệ để tính số phiếu cần phát.
Câu hỏi thường gặp
Nguồn tham khảo
- Dillman, D. A., Smyth, J. D., & Christian, L. M. (2014). Internet, phone, mail, and mixed-mode surveys: The tailored design method (4th ed.). Wiley.
- Hertzog, M. A. (2008). Considerations in determining sample size for pilot studies. Research in Nursing & Health, 31(2), 180–191.
- Johanson, G. A., & Brooks, G. P. (2010). Initial scale development: Sample size for pilot studies. Educational and Psychological Measurement, 70(3), 394–400.
- Lynn, M. R. (1986). Determination and quantification of content validity. Nursing Research, 35(6), 382–385.
- Nguyễn Đình Thọ. (2011). Phương pháp nghiên cứu khoa học trong kinh doanh. NXB Lao động – Xã hội.
- Polit, D. F., & Beck, C. T. (2006). The content validity index: Are you sure you know what's being reported? Critique and recommendations. Research in Nursing & Health, 29(5), 489–497.
- Terwee, C. B., Bot, S. D. M., de Boer, M. R., van der Windt, D. A. W. M., Knol, D. L., Dekker, J., Bouter, L. M., & de Vet, H. C. W. (2007). Quality criteria were proposed for measurement properties of health status questionnaires. Journal of Clinical Epidemiology, 60(1), 34–42.
- Willis, G. B. (2005). Cognitive interviewing: A tool for improving questionnaire design. SAGE Publications.
Ngưỡng đánh giá trong bài là quy ước phổ biến trong các tài liệu trên. Hãy đối chiếu với yêu cầu của giảng viên hướng dẫn hoặc tạp chí bạn nộp bài.