Bỏ qua điều hướng
  1. Trang chủ
  2. Hướng dẫn
  3. Cách tính cỡ mẫu nghiên cứu
Bước 3/10 · Thiết kế khảo sát

Cách tính cỡ mẫu nghiên cứu định lượng: công thức, ví dụ và cách chọn đúng

Không có một công thức cỡ mẫu dùng cho mọi đề tài. Bài này tính lại từng công thức phổ biến bằng ví dụ cụ thể và chỉ ra cách chốt một con số bạn bảo vệ được trước hội đồng.

  • Đội ngũ AutoFillForm
  • Cập nhật
  • 9 phút đọc

Tóm tắt nhanh

  • Cochran cho ước lượng tỷ lệ (Z = 1,96; p = 0,5; e = 0,05): n₀ = 384,16, làm tròn lên 385; với tổng thể N = 2.000, hiệu chỉnh còn 323.
  • Slovin với N = 2.000, e = 0,05 cho 334, nhưng công thức này không tính đến phương pháp phân tích nên không phải căn cứ cho EFA, hồi quy hay SEM.
  • EFA: tối thiểu 50, nên từ 100 trở lên và 5–10 quan sát cho mỗi biến quan sát; 25 biến quan sát cần 125 (5:1) đến 250 (10:1).
  • Hồi quy với 5 biến độc lập: 50 + 8m = 90 và 104 + m = 109; G*Power (f² = 0,15; α = 0,05; power 0,80; 3 biến) cho 77.
  • PLS-SEM theo inverse square root: β_min = 0,2 cần 155, β_min = 0,15 cần 275. Lấy yêu cầu lớn nhất rồi chia cho tỷ lệ phiếu hợp lệ dự kiến.

Cỡ mẫu phụ thuộc vào điều gì

Câu hỏi "cần bao nhiêu phiếu" chỉ có câu trả lời khi bạn biết rõ mình sẽ làm gì với dữ liệu. Có hai nhóm mục tiêu khác nhau:

  • Ước lượng một đặc điểm của tổng thể, ví dụ tỷ lệ sinh viên dùng ví điện tử. Lúc này cỡ mẫu phụ thuộc vào sai số cho phép (e), độ tin cậy (Z) và độ biến thiên của đặc điểm đó. Đây là địa bàn của Cochran, Slovin, Krejcie & Morgan.
  • Kiểm định mô hình nhiều biến, ví dụ EFA, hồi quy bội, PLS-SEM. Lúc này cỡ mẫu phụ thuộc vào số biến quan sát, số biến độc lập, độ lớn hiệu ứng muốn phát hiện, mức ý nghĩa và power (xác suất phát hiện được hiệu ứng nếu nó thật sự tồn tại).

Phần lớn luận văn kinh tế, quản trị thuộc nhóm thứ hai nhưng lại chỉ trích dẫn công thức của nhóm thứ nhất. Lưu ý thêm: mọi công thức trong bài đều giả định mẫu được chọn ngẫu nhiên. Nếu bạn lấy mẫu thuận tiện qua Google Form chia sẻ trên mạng xã hội, cỡ mẫu lớn đến đâu cũng không bù được tính đại diện; bạn chỉ có thể khái quát hóa một cách thận trọng.

Công thức Cochran và hiệu chỉnh tổng thể hữu hạn

Khi mục tiêu là ước lượng một tỷ lệ, Cochran (1977) đưa ra công thức cho tổng thể lớn:

n0 = Z2 × p × (1 − p) / e2
  • Z: giá trị tới hạn ứng với độ tin cậy; 95% tương ứng Z = 1,96.
  • p: tỷ lệ ước đoán của đặc điểm trong tổng thể. Nếu chưa có thông tin, chọn p = 0,5 vì p(1 − p) đạt cực đại tại đó, cho cỡ mẫu an toàn nhất.
  • e: sai số cho phép, thường là 0,05 (±5 điểm phần trăm).

Thay số: n0 = 1,962 × 0,5 × 0,5 / 0,052 = 3,8416 × 0,25 / 0,0025 = 384,16. Cỡ mẫu luôn làm tròn lên, nên n0 = 385.

Khi biết tổng thể N không quá lớn

Nếu tổng thể hữu hạn và đã biết (ví dụ toàn bộ nhân viên một công ty), dùng hiệu chỉnh tổng thể hữu hạn (finite population correction):

n = n0 / (1 + (n0 − 1) / N)

Với tổng thể vài trăm nghìn người, hiệu chỉnh gần như không làm thay đổi con số 385.

Công thức Slovin: dùng được khi nào

Công thức Slovin rất phổ biến trong luận văn vì chỉ cần N và e:

n = N / (1 + N × e2)

Với N = 2.000, e = 0,05: n = 2.000 / (1 + 2.000 × 0,0025) = 2.000 / 6 = 333,3, làm tròn lên 334.

Vì sao Slovin bị phê phán

Tejada & Punzalan (2012) phân tích kỹ cách dùng sai công thức này và chỉ ra rằng:

  • Slovin ngầm giả định p = 0,5 và độ tin cậy xấp xỉ 95%, nhưng người dùng thường không biết và không nêu các giả định này.
  • Nó chỉ phục vụ việc ước lượng một tỷ lệ; hoàn toàn không xét đến phương pháp phân tích, số biến hay độ lớn hiệu ứng. Vì vậy nó không phải căn cứ cho cỡ mẫu EFA, hồi quy hay SEM.
  • Khi tổng thể không xác định hoặc rất lớn, nhiều người điền một con số N phỏng đoán vào công thức. Cách làm đó không có cơ sở; trường hợp này dùng Cochran cho tổng thể lớn sẽ minh bạch hơn.

Đối chiếu với bảng Krejcie & Morgan

Krejcie & Morgan (1970) lập sẵn bảng cỡ mẫu với độ tin cậy 95%, p = 0,5, sai số 5%. Tra N = 2.000 được 322, khớp với kết quả Cochran có hiệu chỉnh (chênh 1 đơn vị do quy ước làm tròn). Bảng hữu ích để kiểm tra chéo, nhưng mang cùng giới hạn với nhóm công thức ước lượng tỷ lệ.

Cỡ mẫu cho EFA, hồi quy và phân tích power

Phân tích nhân tố khám phá (EFA)

Hair & cộng sự (2019) khuyến nghị cỡ mẫu tối thiểu 50, tốt hơn là từ 100 trở lên, và tối thiểu 5 quan sát cho mỗi biến quan sát, tốt hơn là tỷ lệ 10:1. Ở Việt Nam, quy tắc thường được viết là n ≥ 5 × số biến quan sát. Bảng hỏi có 25 biến quan sát cần ít nhất 125 phiếu theo tỷ lệ 5:1, và 250 phiếu nếu theo 10:1. Đây là quy tắc kinh nghiệm, mức đủ còn phụ thuộc hệ số tải và số biến mỗi nhân tố. Cách đọc kết quả xem tại bài KMO, Bartlett và EFA.

Hồi quy bội

Tabachnick & Fidell (2013), dựa trên Green (1991), đưa ra hai quy tắc với m là số biến độc lập:

  • N ≥ 50 + 8m để kiểm định R2 của toàn mô hình.
  • N ≥ 104 + m để kiểm định từng hệ số hồi quy.

Với m = 5: 50 + 8 × 5 = 90 và 104 + 5 = 109. Vì luận văn hầu như luôn diễn giải từng hệ số, hãy lấy số lớn hơn là 109. Hai quy tắc này giả định hiệu ứng mức trung bình, α = 0,05 và power 0,80.

Phân tích power bằng G*Power

Cách chặt chẽ hơn là phân tích power tiên nghiệm (a priori) bằng phần mềm miễn phí G*Power (Faul & cộng sự, 2007). Thiết lập cho hồi quy bội:

Test family:               F tests
Statistical test:          Linear multiple regression: Fixed model, R² deviation from zero
Type of power analysis:    A priori
Effect size f²:            0.15
α err prob:                0.05
Power (1-β err prob):      0.80
Number of predictors:      3
→ Total sample size:       77

Effect size f2 = R2 / (1 − R2); Cohen (1988) quy ước 0,02 là nhỏ, 0,15 là trung bình, 0,35 là lớn. α = 0,05 là mức ý nghĩa; power 0,80 nghĩa là 80% khả năng phát hiện hiệu ứng trung bình nếu nó tồn tại. Nếu kỳ vọng hiệu ứng nhỏ hơn, cỡ mẫu cần thiết sẽ tăng mạnh. Khi chạy hồi quy, hãy xem bài đọc kết quả hồi quy SPSS.

Cỡ mẫu cho PLS-SEM

Quy tắc 10 lần và vì sao không nên dựa vào nó

Quy tắc 10 lần (Barclay, Higgins & Thompson, 1995) yêu cầu cỡ mẫu ít nhất bằng 10 lần số lớn hơn giữa: số chỉ báo cấu tạo (formative) nhiều nhất của một khái niệm, và số đường dẫn cấu trúc nhiều nhất trỏ vào một khái niệm. Nếu biến phụ thuộc nhận 4 mũi tên thì n ≥ 40. Quy tắc này bỏ qua độ lớn hiệu ứng và power. Kock & Hadaya (2018) cho thấy nó thường cho cỡ mẫu quá nhỏ, nhất là khi hệ số đường dẫn nhỏ.

Phương pháp inverse square root

Kock & Hadaya (2018) đề xuất công thức đơn giản dựa trên hệ số đường dẫn nhỏ nhất mà bạn kỳ vọng có ý nghĩa (βmin), với mức ý nghĩa 5% và power 80%:

nmin > (2,486 / |βmin|)2
  • βmin = 0,2: (2,486 / 0,2)2 = 12,432 = 154,5 → 155.
  • βmin = 0,15: (2,486 / 0,15)2 ≈ 16,5732 ≈ 274,7 → 275.

βmin nên lấy từ các nghiên cứu trước có mô hình tương tự. Nếu không có căn cứ, chọn giá trị thận trọng như 0,15 thay vì đoán lạc quan. Sau khi có dữ liệu, bước đánh giá mô hình đo lường được trình bày ở bài CR, AVE và HTMT.

Bảng so sánh các phương pháp tính cỡ mẫu

Các ví dụ dùng cùng giả định như trong bài
Phương phápKhi nào dùngCông thức / quy tắcVí dụ
Cochran (1977)Ước lượng tỷ lệ, tổng thể lớnn0 = Z2p(1 − p)/e2385
Cochran có hiệu chỉnhƯớc lượng tỷ lệ, biết Nn0 / (1 + (n0 − 1)/N)N = 2.000 → 323
SlovinƯớc lượng tỷ lệ, biết N, chấp nhận giả định ngầmN / (1 + Ne2)N = 2.000 → 334
Krejcie & Morgan (1970)Kiểm tra chéo bằng bảng traBảng tra sẵnN = 2.000 → 322
EFA (Hair & cộng sự, 2019)Phân tích nhân tố khám phá≥ 100; 5:1, tốt hơn 10:125 biến → 125 / 250
Tabachnick & Fidell (2013)Hồi quy bội50 + 8m; 104 + mm = 5 → 90; 109
G*Power (Faul & cộng sự, 2007)Hồi quy, có giả định hiệu ứngf2, α, power, số biếnf2 = 0,15; 3 biến → 77
Quy tắc 10 lầnƯớc lượng thô PLS-SEM, không khuyến khích10 × số mũi tên lớn nhất4 mũi tên → 40
Inverse square root (Kock & Hadaya, 2018)PLS-SEM(2,486/|βmin|)2β = 0,2 → 155; β = 0,15 → 275

Quy trình chốt cỡ mẫu cho đề tài của bạn

  1. Liệt kê mọi phân tích sẽ chạy: Cronbach's Alpha, EFA, hồi quy, PLS-SEM, so sánh nhóm.
  2. Tính yêu cầu cho từng phân tích bằng phương pháp phù hợp ở bảng trên.
  3. Lấy con số lớn nhất, vì mẫu phải đủ cho phân tích khắt khe nhất.
  4. Cộng thêm dự phòng cho phiếu không hợp lệ: số phiếu cần gửi = số phiếu hợp lệ cần có / tỷ lệ hợp lệ dự kiến.
  5. Ghi rõ phương pháp chọn mẫu và giới hạn khái quát hóa nếu không chọn mẫu ngẫu nhiên.

Tỷ lệ hợp lệ dự kiến nên lấy từ pilot test bảng hỏi thay vì đoán. Nếu muốn diễn tập trước toàn bộ quy trình phân tích ở đúng cỡ mẫu dự kiến, bạn có thể dùng module nghiên cứu SPSS để sinh dữ liệu mô phỏng, kiểm tra cú pháp và các bước xuất dữ liệu. Dữ liệu mô phỏng chỉ dùng để luyện quy trình, tuyệt đối không được báo cáo như dữ liệu thu thập thật.

Những lỗi thường gặp

  • Dùng Slovin làm căn cứ duy nhất cho đề tài chạy EFA và hồi quy.
  • Điền một N phỏng đoán khi tổng thể thực ra không xác định.
  • Làm tròn xuống, hoặc lấy đúng con số tối thiểu mà không dự phòng phiếu không hợp lệ.
  • Viết "cỡ mẫu lớn nên đại diện" trong khi chọn mẫu thuận tiện.

Checklist và cách trình bày trong báo cáo

  • Đã tính yêu cầu cho từng phân tích, ghi rõ công thức, giá trị đầu vào và nguồn trích dẫn.
  • Mọi kết quả đều được làm tròn lên.
  • Đã chọn con số lớn nhất và giải thích vì sao.
  • Đã cộng dự phòng theo tỷ lệ phiếu hợp lệ dự kiến từ pilot.
  • Đã nêu phương pháp chọn mẫu và giới hạn khái quát hóa.
  • Bảng hỏi trên Google Form có câu sàng lọc đúng đối tượng.

Một đoạn trình bày mẫu: "Nghiên cứu sử dụng PLS-SEM và EFA với 25 biến quan sát. Theo phương pháp inverse square root (Kock & Hadaya, 2018) với βmin = 0,15, cỡ mẫu tối thiểu là 275; theo tỷ lệ 10:1 (Hair & cộng sự, 2019) là 250. Tác giả đặt mục tiêu 300 phiếu hợp lệ và phát ra 375 phiếu với tỷ lệ hợp lệ dự kiến 80%."

Câu hỏi thường gặp

Không nên dùng Slovin làm căn cứ duy nhất. Slovin chỉ phục vụ ước lượng một tỷ lệ, ngầm giả định p = 0,5 và độ tin cậy khoảng 95%, và không xét đến số biến hay phương pháp phân tích. Với EFA và hồi quy, hãy dùng quy tắc của Hair và cộng sự (2019), Tabachnick và Fidell (2013) hoặc phân tích power bằng G*Power, rồi chọn con số lớn nhất.
Nếu mục tiêu là ước lượng tỷ lệ, dùng công thức Cochran cho tổng thể lớn: với Z = 1,96, p = 0,5 và e = 0,05, kết quả là 385. Không nên điền một N phỏng đoán vào Slovin. Nếu mục tiêu là kiểm định mô hình, N gần như không ảnh hưởng; yêu cầu đến từ số biến, độ lớn hiệu ứng và power.
Hair và cộng sự (2019) khuyến nghị tối thiểu 50, tốt hơn là từ 100 trở lên, với ít nhất 5 quan sát cho mỗi biến quan sát và tốt hơn là 10 quan sát. Bảng hỏi 25 biến quan sát cần ít nhất 125 phiếu theo tỷ lệ 5:1 và 250 phiếu theo tỷ lệ 10:1. Đây là quy tắc kinh nghiệm, không phải ngưỡng tuyệt đối.
Nên dùng phương pháp inverse square root của Kock và Hadaya (2018): n lớn hơn bình phương của 2,486 chia cho hệ số đường dẫn nhỏ nhất kỳ vọng. Với β nhỏ nhất bằng 0,2 cần 155 quan sát, với 0,15 cần 275. Quy tắc 10 lần dễ dùng nhưng bỏ qua độ lớn hiệu ứng và power nên thường cho con số quá nhỏ.
Có. Một phần phiếu sẽ bị loại do trả lời thiếu, sai đối tượng hoặc trả lời đồng loạt một mức. Hãy lấy tỷ lệ phiếu hợp lệ từ pilot test, rồi chia số phiếu hợp lệ cần có cho tỷ lệ đó. Ví dụ cần 300 phiếu hợp lệ và dự kiến 80% hợp lệ thì phải thu ít nhất 375 phiếu.

Nguồn tham khảo

  1. Barclay, D., Higgins, C., & Thompson, R. (1995). The partial least squares (PLS) approach to causal modeling: Personal computer adoption and use as an illustration. Technology Studies, 2(2), 285–309.
  2. Cochran, W. G. (1977). Sampling techniques (3rd ed.). John Wiley & Sons.
  3. Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Lawrence Erlbaum Associates.
  4. Faul, F., Erdfelder, E., Lang, A.-G., & Buchner, A. (2007). G*Power 3: A flexible statistical power analysis program for the social, behavioral, and biomedical sciences. Behavior Research Methods, 39(2), 175–191.
  5. Green, S. B. (1991). How many subjects does it take to do a regression analysis? Multivariate Behavioral Research, 26(3), 499–510.
  6. Hair, J. F., Black, W. C., Babin, B. J., & Anderson, R. E. (2019). Multivariate data analysis (8th ed.). Cengage Learning.
  7. Kock, N., & Hadaya, P. (2018). Minimum sample size estimation in PLS-SEM: The inverse square root and gamma-exponential methods. Information Systems Journal, 28(1), 227–261.
  8. Krejcie, R. V., & Morgan, D. W. (1970). Determining sample size for research activities. Educational and Psychological Measurement, 30(3), 607–610.
  9. Tabachnick, B. G., & Fidell, L. S. (2013). Using multivariate statistics (6th ed.). Pearson.
  10. Tejada, J. J., & Punzalan, J. R. B. (2012). On the misuse of Slovin's formula. The Philippine Statistician, 61(1), 129–136.

Ngưỡng đánh giá trong bài là quy ước phổ biến trong các tài liệu trên. Hãy đối chiếu với yêu cầu của giảng viên hướng dẫn hoặc tạp chí bạn nộp bài.

100 credit cho tài khoản mới

Bắt đầu với biểu mẫu của bạn

Import, cấu hình và xem chi phí trước khi chạy.

Tạo tài khoản miễn phí