Bỏ qua điều hướng
  1. Trang chủ
  2. Hướng dẫn
  3. Pilot test bảng hỏi
Bước 4/10 · Thiết kế khảo sát

Pilot test bảng hỏi: cỡ mẫu khảo sát thử, quy trình 3 bước và checklist

Pilot test là lần chạy thử bảng hỏi với chuyên gia và người thật để sửa lỗi trước khi phát hàng trăm phiếu. Bài này hướng dẫn từng giai đoạn, cỡ mẫu cần thiết và cách đọc kết quả.

  • Đội ngũ AutoFillForm
  • Cập nhật
  • 8 phút đọc

Tóm tắt nhanh

  • Pilot test gồm 3 giai đoạn: đánh giá chuyên gia (CVI), phỏng vấn nhận thức 5–15 người, và khảo sát thử định lượng quy mô nhỏ.
  • CVI: ít nhất 3 chuyên gia; với tối đa 5 chuyên gia I-CVI phải bằng 1,00, với 6–10 chuyên gia I-CVI ≥ 0,78; S-CVI/Ave ≥ 0,90.
  • Khảo sát thử: ít nhất 30 người thuộc tổng thể mục tiêu khi phát triển thang đo (Johanson & Brooks, 2010).
  • Đọc thời gian hoàn thành, tỷ lệ bỏ dở, câu bị bỏ trống, hiệu ứng sàn/trần trên 15% và câu gần như không có phương sai; Cronbach's Alpha chỉ mang tính sơ bộ.
  • Diễn tập quy trình dữ liệu bằng phản hồi thử chỉ để bắt lỗi kỹ thuật, không thay thế người trả lời thật và không bao giờ được báo cáo như dữ liệu.

Pilot test bảng hỏi kiểm tra những gì

Pilot test (khảo sát thử) là bước chạy bảng hỏi ở quy mô nhỏ trước khi thu dữ liệu chính thức. Mục tiêu không phải để có kết quả nghiên cứu mà để phát hiện lỗi khi việc sửa còn rẻ. Dillman & cộng sự (2014) khuyến nghị kết hợp nhiều hình thức kiểm tra trước, vì mỗi hình thức bắt được một loại lỗi khác nhau. Một pilot tốt trả lời được sáu câu hỏi:

  • Từ ngữ: người trả lời có hiểu câu hỏi đúng như bạn định hỏi không?
  • Thời lượng: mất bao lâu để hoàn thành, có quá dài không?
  • Trình tự: thứ tự câu hỏi có gây mệt mỏi hoặc dẫn dắt câu trả lời không?
  • Rẽ nhánh: mỗi nhóm đối tượng có đi đúng phần câu hỏi dành cho mình không?
  • Đường ống dữ liệu: dữ liệu từ Google Form sang Sheet, sang SPSS có đúng định dạng không?
  • Tính khả thi: tiếp cận được đối tượng không, tỷ lệ phiếu hợp lệ khoảng bao nhiêu?

Trong luận văn ở Việt Nam

Nguyễn Đình Thọ (2011) mô tả quy trình gồm nghiên cứu sơ bộ và nghiên cứu chính thức. Nghiên cứu sơ bộ thường có hai phần: nghiên cứu sơ bộ định tính (thảo luận với chuyên gia, phỏng vấn sâu để điều chỉnh thang đo) và nghiên cứu định lượng sơ bộ (khảo sát mẫu nhỏ để đánh giá sơ bộ thang đo). Ba giai đoạn dưới đây khớp với cách chia này: giai đoạn 1 và 2 thuộc phần định tính, giai đoạn 3 là định lượng sơ bộ.

Giai đoạn 1: đánh giá chuyên gia và chỉ số CVI

Mời các chuyên gia (giảng viên, người làm nghề trong lĩnh vực) chấm mức độ phù hợp của từng câu với khái niệm cần đo trên thang 4 điểm: 1 = không phù hợp, 2 = cần sửa nhiều, 3 = phù hợp nhưng cần sửa nhỏ, 4 = rất phù hợp. Từ đó tính chỉ số giá trị nội dung (content validity index, CVI):

  • I-CVI của một câu = số chuyên gia chấm 3 hoặc 4 / tổng số chuyên gia.
  • S-CVI/Ave của cả thang đo = trung bình các I-CVI.

Theo Lynn (1986), cần ít nhất 3 chuyên gia; nếu có từ 5 chuyên gia trở xuống thì I-CVI phải bằng 1,00, với 6–10 chuyên gia thì I-CVI không thấp hơn 0,78. Polit & Beck (2006) đề nghị S-CVI/Ave từ 0,90 trở lên và nhấn mạnh phải báo cáo rõ đã dùng cách tính nào.

Ví dụ minh họa: 6 chuyên gia chấm 5 câu hỏi
CâuĐiểm của 6 chuyên giaSố người chấm 3–4I-CVIKết luận
Q14, 4, 3, 4, 3, 461,00Giữ
Q24, 3, 3, 4, 4, 361,00Giữ
Q34, 4, 2, 3, 4, 350,83Giữ, xem góp ý
Q43, 2, 4, 2, 3, 440,67Sửa hoặc thay
Q54, 4, 4, 3, 4, 461,00Giữ

S-CVI/Ave = (1,00 + 1,00 + 0,83 + 0,67 + 1,00) / 5 = 0,90 (tính bằng phân số chính xác là 4,5 / 5). Thang đo vừa đạt ngưỡng chung, nhưng Q4 vẫn dưới 0,78 và phải sửa. Đừng để chỉ số trung bình che đi một câu yếu.

Giai đoạn 2: phỏng vấn nhận thức

Phỏng vấn nhận thức (cognitive interview) cho biết người trả lời nghĩ gì khi đọc câu hỏi. Willis (2005) mô tả hai kỹ thuật chính, thường được thực hiện theo vòng với khoảng 5–15 người, sửa bảng hỏi giữa các vòng:

  • Nói to suy nghĩ (think-aloud): người tham gia vừa trả lời vừa nói ra những gì đang nghĩ.
  • Hỏi thăm dò (verbal probing): người phỏng vấn đặt câu hỏi phụ sau từng câu hoặc cuối bảng hỏi.

Một số câu thăm dò mẫu:

  • "Bạn hiểu cụm từ 'trải nghiệm số' trong câu này là gì?"
  • "Bạn có thể nói lại câu hỏi này bằng lời của mình không?"
  • "Vì sao bạn chọn mức 4 mà không phải mức 5?"
  • "Có lựa chọn nào bạn muốn chọn nhưng không có không?"
  • "Câu nào khiến bạn phải đọc lại hoặc thấy khó trả lời thật lòng?"

Chọn người tham gia đúng đối tượng khảo sát, không phải bạn cùng nhóm nghiên cứu. Ghi lại từng vấn đề theo mã câu để đưa vào nhật ký chỉnh sửa.

Diễn tập quy trình dữ liệu trước khi khảo sát thử

Trước khi gửi form cho người thật, hãy chắc chắn hệ thống kỹ thuật chạy đúng. Lỗi rẽ nhánh hay lỗi mã hóa phát hiện sau khi đã có 30 người trả lời sẽ làm hỏng cả vòng pilot.

  1. Đi hết mọi nhánh: dùng chế độ Xem trước (Preview) và gửi phản hồi thử cho từng lựa chọn có thiết lập "Chuyển đến phần dựa trên câu trả lời (Go to section based on answer)". Cách thiết lập xem tại bài tạo Google Form khảo sát chuẩn.
  2. Kiểm tra Sheet xuất ra: thứ tự cột, câu hộp kiểm (Checkboxes) gộp nhiều đáp án trong một ô, câu lưới trắc nghiệm (Multiple choice grid) xuất nhãn chữ thay vì số.
  3. Kiểm tra mã hóa SPSS: chạy thử cú pháp mã hóa, đảo chiều câu nghịch, gán nhãn giá trị. Lỗi kinh điển là dùng Transform → Automatic Recode, công cụ này đánh số theo thứ tự chữ cái nên "Đồng ý" có thể nhận mã nhỏ hơn "Hoàn toàn không đồng ý". Quy trình chi tiết ở bài xuất dữ liệu Google Form sang SPSS.
  4. Chạy thử script phân tích đến bước cuối để chắc mọi biến đều có mặt.

Khi cần gửi nhiều phản hồi thử qua tất cả các nhánh, Google Form Auto Filler của AutoFillForm có thể đọc cấu trúc form và gửi phản hồi theo cấu hình. Để diễn tập phần phân tích, module nghiên cứu SPSS sinh dữ liệu Likert mô phỏng và xuất cú pháp .sps.

Giai đoạn 3: khảo sát thử định lượng

Cỡ mẫu khảo sát thử

Johanson & Brooks (2010) khuyến nghị ít nhất 30 người thuộc tổng thể mục tiêu cho giai đoạn phát triển thang đo ban đầu. Hertzog (2008) cho thấy cỡ mẫu pilot hợp lý dao động khoảng 10–40 người mỗi nhóm tùy mục đích: kiểm tra tính khả thi cần ít hơn, ước lượng tham số cần nhiều hơn. Pilot không dùng để kiểm định giả thuyết, nên đừng tính power cho nó. Cỡ mẫu chính thức xem tại bài cách tính cỡ mẫu.

Các chỉ số cần đọc

Chỉ sốCách đoDấu hiệu cần xem lại
Thời gian hoàn thànhTrung vị (median), vì vài người để form mở rất lâu làm trung bình bị lệchVượt xa thời lượng bạn ghi trong lời mời
Bỏ dở theo phầnSố người dừng ở mỗi phầnMột phần có số người dừng tăng đột biến
Câu bị bỏ trốngTỷ lệ trống ở câu không bắt buộcMột câu bị bỏ trống nhiều hơn hẳn các câu khác
Hiệu ứng sàn/trầnTỷ lệ người đạt điểm thấp nhất hoặc cao nhất có thểTrên 15% người trả lời (Terwee & cộng sự, 2007)
Phương sai câu hỏiĐộ lệch chuẩn, phân bố tần sốGần như ai cũng chọn cùng một mức
Cronbach's Alpha sơ bộAlpha và tương quan biến–tổngTương quan âm, thường do quên đảo chiều câu nghịch

Google Form chỉ lưu phản hồi đã gửi và dấu thời gian lúc gửi, không lưu lúc bắt đầu hay phiếu bỏ dở. Vì vậy thời gian và tỷ lệ bỏ dở nên đo bằng cách quan sát trực tiếp một phần người tham gia, nhờ họ ghi giờ bắt đầu, hoặc so số lời mời với số phiếu nhận được. Muốn thấy câu bị bỏ trống, đừng đặt tất cả câu ở chế độ Bắt buộc (Required) trong vòng pilot.

Ngưỡng 15% của Terwee & cộng sự (2007) được đề xuất cho điểm tổng của thang đo; với từng câu Likert, hãy dùng như tín hiệu để xem lại chứ không phải tiêu chí loại câu. Cronbach's Alpha ở n = 30 dao động mạnh giữa các mẫu, nên đừng xóa câu chỉ để nâng alpha của pilot. Cách đọc đầy đủ có tại bài Cronbach's Alpha trong SPSS.

Câu hỏi phản hồi cuối bảng hỏi

Thêm một câu Đoạn (Paragraph) không bắt buộc ở cuối form pilot: "Có câu nào khó hiểu, khó trả lời hoặc thiếu lựa chọn phù hợp không? Vui lòng ghi số câu và lý do." Câu này thường chỉ ra đúng chỗ mà các chỉ số định lượng chỉ gợi ý.

Nhật ký chỉnh sửa và chuyện gộp dữ liệu pilot

Mọi thay đổi sau pilot nên được ghi vào nhật ký chỉnh sửa, vì hội đồng thường hỏi "thang đo đã điều chỉnh thế nào so với bản gốc".

Mã câuVấn đềBằng chứngChỉnh sửaPhiên bản
Q4Chuyên gia cho là đo hai ý trong một câuI-CVI = 0,67Tách thành Q4a, Q4bv2
Q12Người trả lời hiểu "nền tảng số" khác nhau3/8 người trong phỏng vấn nhận thứcThêm ví dụ trong ngoặcv2

Có được gộp dữ liệu pilot vào mẫu chính thức không?

Nhìn chung là không nếu bảng hỏi đã thay đổi, dù chỉ là từ ngữ, vì hai nhóm đã trả lời hai công cụ đo khác nhau. Ngay cả khi không sửa gì, cách an toàn nhất vẫn là tách riêng dữ liệu pilot và báo cáo rõ. Cũng nên loại người đã tham gia pilot khỏi đợt chính thức để tránh việc họ trả lời theo trí nhớ.

Checklist pilot test bảng hỏi

  • Đã có ít nhất 3 chuyên gia chấm điểm; mọi câu đạt ngưỡng I-CVI và S-CVI/Ave ≥ 0,90.
  • Đã phỏng vấn nhận thức 5–15 người đúng đối tượng, sửa câu và chạy lại vòng nếu cần.
  • Đã đi thử mọi nhánh rẽ, kiểm tra Sheet, cú pháp mã hóa SPSS và script phân tích.
  • Đã xóa toàn bộ phản hồi thử và tạo Sheet mới trước khi mở form cho người thật.
  • Đã khảo sát thử với ít nhất 30 người thuộc tổng thể mục tiêu.
  • Đã đọc thời gian hoàn thành, bỏ dở, câu bị bỏ trống, sàn/trần, phương sai và alpha sơ bộ.
  • Đã ghi nhật ký chỉnh sửa và đánh số phiên bản bảng hỏi.
  • Đã quyết định và ghi rõ dữ liệu pilot được tách riêng.
  • Đã ước tính tỷ lệ phiếu hợp lệ để tính số phiếu cần phát.

Câu hỏi thường gặp

Tùy giai đoạn. Đánh giá chuyên gia cần ít nhất 3 người theo Lynn (1986), thường 6–10 người. Phỏng vấn nhận thức thường 5–15 người mỗi vòng. Khảo sát thử định lượng nên có ít nhất 30 người thuộc tổng thể mục tiêu theo Johanson và Brooks (2010); Hertzog (2008) cho thấy khoảng 10–40 người mỗi nhóm tùy mục đích của pilot.
Nhìn chung là không nếu bảng hỏi đã được sửa sau pilot, kể cả chỉ sửa từ ngữ, vì người trả lời pilot đã dùng một công cụ đo khác. Cách an toàn nhất là luôn tách riêng dữ liệu pilot, báo cáo nó như nghiên cứu sơ bộ và không khảo sát lại những người đã tham gia pilot trong đợt chính thức.
I-CVI là tỷ lệ chuyên gia chấm 3 hoặc 4 điểm cho một câu cụ thể. S-CVI/Ave là trung bình I-CVI của tất cả các câu trong thang đo. Polit và Beck (2006) đề nghị S-CVI/Ave từ 0,90 trở lên, nhưng một thang đo đạt mức này vẫn có thể chứa câu có I-CVI thấp cần sửa.
Không nên xóa chỉ dựa vào alpha của pilot, vì với khoảng 30 người alpha dao động rất mạnh. Hãy kiểm tra trước các lỗi kỹ thuật như quên đảo chiều câu nghịch hay mã hóa sai, sau đó đọc góp ý từ phỏng vấn nhận thức. Quyết định loại biến nên dựa trên dữ liệu chính thức và lý thuyết.
Không. Phản hồi thử hoặc dữ liệu mô phỏng chỉ giúp kiểm tra rẽ nhánh, định dạng Sheet, mã hóa SPSS và cú pháp phân tích. Chúng không cho biết người thật có hiểu câu hỏi không, mất bao lâu để trả lời hay bỏ dở ở đâu, và không bao giờ được báo cáo như dữ liệu thu thập.

Nguồn tham khảo

  1. Dillman, D. A., Smyth, J. D., & Christian, L. M. (2014). Internet, phone, mail, and mixed-mode surveys: The tailored design method (4th ed.). Wiley.
  2. Hertzog, M. A. (2008). Considerations in determining sample size for pilot studies. Research in Nursing & Health, 31(2), 180–191.
  3. Johanson, G. A., & Brooks, G. P. (2010). Initial scale development: Sample size for pilot studies. Educational and Psychological Measurement, 70(3), 394–400.
  4. Lynn, M. R. (1986). Determination and quantification of content validity. Nursing Research, 35(6), 382–385.
  5. Nguyễn Đình Thọ. (2011). Phương pháp nghiên cứu khoa học trong kinh doanh. NXB Lao động – Xã hội.
  6. Polit, D. F., & Beck, C. T. (2006). The content validity index: Are you sure you know what's being reported? Critique and recommendations. Research in Nursing & Health, 29(5), 489–497.
  7. Terwee, C. B., Bot, S. D. M., de Boer, M. R., van der Windt, D. A. W. M., Knol, D. L., Dekker, J., Bouter, L. M., & de Vet, H. C. W. (2007). Quality criteria were proposed for measurement properties of health status questionnaires. Journal of Clinical Epidemiology, 60(1), 34–42.
  8. Willis, G. B. (2005). Cognitive interviewing: A tool for improving questionnaire design. SAGE Publications.

Ngưỡng đánh giá trong bài là quy ước phổ biến trong các tài liệu trên. Hãy đối chiếu với yêu cầu của giảng viên hướng dẫn hoặc tạp chí bạn nộp bài.

100 credit cho tài khoản mới

Bắt đầu với biểu mẫu của bạn

Import, cấu hình và xem chi phí trước khi chạy.

Tạo tài khoản miễn phí