Bỏ qua điều hướng
  1. Trang chủ
  2. Hướng dẫn
  3. KMO, Bartlett và EFA
Bước 7/10 · Dữ liệu và thang đo

Phân tích nhân tố khám phá EFA trong SPSS: KMO, Bartlett và ma trận xoay

EFA cho biết các biến quan sát có thực sự gom thành những nhân tố như thang đo dự kiến hay không. Bài này đi qua từng hộp thoại SPSS, từng bảng kết quả và các ngưỡng kèm nguồn để bạn đọc và báo cáo đúng.

  • Đội ngũ AutoFillForm
  • Cập nhật
  • 9 phút đọc

Tóm tắt nhanh

  • Chạy tại Analyze → Dimension Reduction → Factor; tích KMO and Bartlett's test of sphericity và Anti-image ở Descriptives.
  • KMO ≥ 0,50 là tối thiểu, ≥ 0,80 là rất tốt (Kaiser, 1974); Bartlett cần Sig. < 0,05; MSA từng biến trên đường chéo Anti-image ≥ 0,50.
  • Thang đo sẽ đi tiếp sang CFA/SEM: dùng Principal axis factoring + Promax; chỉ khám phá, rút gọn dữ liệu: Principal components + Varimax là lựa chọn phổ biến.
  • Tổng phương sai trích ≥ 50% là quy ước phổ biến ở Việt Nam; Hair và cộng sự (2019) cho rằng khoảng 60% thường được xem là thỏa đáng trong khoa học xã hội.
  • Hệ số tải ≥ 0,50 là có ý nghĩa thực tiễn; biến tải chéo với chênh lệch < 0,20 là ứng viên loại, loại từng biến một rồi chạy lại.

EFA là gì và nằm ở đâu trong quy trình

Phân tích nhân tố khám phá (Exploratory Factor Analysis, EFA) tìm cấu trúc ẩn đằng sau ma trận tương quan của các biến quan sát. Với 5 thang đo gồm 20 câu Likert, EFA cho biết dữ liệu có gom thành 5 nhóm như dự kiến không, câu nào tải sai nhóm, câu nào tải lên hai nhóm.

Trong luận văn định lượng, EFA đứng giữa chuỗi đánh giá thang đo:

  1. Kiểm tra độ tin cậy bằng Cronbach's Alpha cho từng thang đo, loại biến có tương quan biến tổng quá thấp.
  2. EFA cho toàn bộ biến còn lại để kiểm tra giá trị hội tụ và phân biệt ở mức khám phá.
  3. Khẳng định lại bằng CFA hoặc mô hình đo lường PLS-SEM, với các chỉ số CR, AVE và HTMT.

EFA cần mẫu đủ lớn. Hair và cộng sự (2019) khuyến nghị tối thiểu 50 quan sát, tốt hơn là từ 100 trở lên, với tỷ lệ ít nhất 5 quan sát cho mỗi biến, tốt hơn là 10:1. Cách tính chi tiết có trong bài cách tính cỡ mẫu nghiên cứu. Biến đảo chiều phải được mã hóa lại trước khi chạy (xem bài xuất dữ liệu Google Form sang SPSS).

Các bước chạy EFA trong SPSS

Mở Analyze → Dimension Reduction → Factor, đưa các biến quan sát của thang đo (không đưa biến nhân khẩu học) vào ô Variables, rồi thiết lập bốn hộp thoại.

Descriptives

Tích KMO and Bartlett's test of sphericity và Anti-image.

Extraction: PAF hay PCA

Hai phép trích hay dùng trong ô Method:

  • Principal components (PCA): rút gọn dữ liệu, gom toàn bộ phương sai (kể cả phần riêng và sai số) vào ít thành phần. Về lý thuyết, PCA không phải mô hình nhân tố tiềm ẩn.
  • Principal axis factoring (PAF) hoặc Maximum likelihood: chỉ phân tích phần phương sai chung, phù hợp khi bạn tin rằng câu hỏi phản ánh một khái niệm tiềm ẩn. Costello & Osborne (2005) khuyến nghị dùng các phép trích này thay vì PCA.

Thực hành phổ biến ở Việt Nam: PCA + Varimax khi thuần túy khám phá; PAF + Promax khi thang đo sẽ được kiểm định tiếp bằng CFA/SEM, vì cách này phản ánh cấu trúc dữ liệu sát hơn (Nguyễn Đình Thọ, 2011, dựa trên Gerbing & Anderson, 1988). Trong hộp thoại này, chọn Based on Eigenvalue với Eigenvalues greater than: 1 và tích Scree plot.

Rotation: Promax hay Varimax

  • Promax (xoay xiên, oblique): cho phép các nhân tố tương quan với nhau. Các khái niệm như hài lòng và ý định quay lại hầu như luôn tương quan, nên Promax thực tế hơn. Tabachnick & Fidell (2013) gợi ý: nếu tương quan giữa các nhân tố vượt 0,32, phép xoay xiên là hợp lý.
  • Varimax (xoay vuông góc, orthogonal): giả định các nhân tố không tương quan, điều hiếm khi đúng với dữ liệu thái độ.

Options

Tích Sorted by size và Suppress small coefficients với Absolute value below: .30 để ma trận xoay chỉ hiện các hệ số đáng chú ý.

Bấm Paste thay vì OK để lưu cú pháp, chạy lại nhanh sau mỗi lần loại biến:

FACTOR
  /VARIABLES CL1 CL2 CL3 CL4 GC1 GC2 GC3 GC4 HA1 HA2 HA3 HA4
    HL1 HL2 HL3 HL4 YD1 YD2 YD3 YD4
  /MISSING LISTWISE
  /PRINT INITIAL KMO AIC EXTRACTION ROTATION
  /FORMAT SORT BLANK(.30)
  /PLOT EIGEN
  /CRITERIA MINEIGEN(1) ITERATE(25)
  /EXTRACTION PAF
  /CRITERIA ITERATE(25)
  /ROTATION PROMAX(4)
  /METHOD=CORRELATION.

Từ khóa AIC tương ứng với ô Anti-image; nếu dùng PCA + Varimax, đổi thành /EXTRACTION PC và /ROTATION VARIMAX.

Đọc KMO, Bartlett và MSA từng biến

KMO (Kaiser–Meyer–Olkin) so sánh độ lớn tương quan giữa các biến với tương quan riêng phần. KMO cao nghĩa là các biến chia sẻ nhiều phương sai chung, đủ để gom nhân tố. Kaiser (1974) đưa ra thang đánh giá sau:

Thang đánh giá KMO theo Kaiser (1974)
Giá trị KMOKaiser (1974)Diễn giải
≥ 0,90marvelousTuyệt vời
0,80 – 0,89meritoriousRất tốt
0,70 – 0,79middlingKhá
0,60 – 0,69mediocreTrung bình
0,50 – 0,59miserableKém
< 0,50unacceptableKhông chấp nhận

Kiểm định Bartlett (Bartlett, 1954) có giả thuyết H0: ma trận tương quan là ma trận đơn vị, tức các biến không tương quan với nhau. Cần Sig. < 0,05 để bác bỏ H0. Kiểm định này rất nhạy với cỡ mẫu, gần như luôn có ý nghĩa khi có vài trăm quan sát (Tabachnick & Fidell, 2013), nên chỉ là điều kiện cần.

MSA từng biến: trong bảng Anti-image Matrices, phần Anti-image Correlation, các giá trị trên đường chéo (đánh dấu chữ a) là KMO riêng của từng biến. Biến có MSA < 0,50 nên được xem xét loại trước khi đọc tiếp (Field, 2018).

Phương sai trích và số nhân tố cần giữ

Bảng Total Variance Explained có ba khối cột. Initial Eigenvalues dựa trên toàn bộ phương sai; Extraction Sums of Squared Loadings là phần phép trích thực sự giải thích, với PAF luôn thấp hơn. Khi xoay Promax, khối Rotation Sums chỉ có cột Total vì các nhân tố tương quan nên không cộng dồn phần trăm được. Con số "tổng phương sai trích" cần báo cáo là cột Cumulative % của khối Extraction.

Về ngưỡng, ở Việt Nam ≥ 50% là quy ước phổ biến; Hair và cộng sự (2019) cho rằng trong khoa học xã hội, khoảng 60% (đôi khi thấp hơn) thường được xem là thỏa đáng.

Đừng chỉ dựa vào eigenvalue > 1

Tiêu chí Kaiser (eigenvalue > 1) có xu hướng trích thừa nhân tố, nhất là khi có nhiều biến. Costello & Osborne (2005) khuyến nghị kết hợp biểu đồ scree (giữ các nhân tố nằm trước "khuỷu") và parallel analysis (Horn, 1965): chỉ giữ nhân tố có eigenvalue thực lớn hơn eigenvalue trung bình (hoặc bách phân vị 95) từ dữ liệu ngẫu nhiên cùng kích thước. Nếu phiên bản SPSS của bạn không có sẵn tùy chọn này, dùng macro của O'Connor (2000).

Trích bảng Total Variance Explained (số liệu minh họa)
Nhân tốInitial Eigenvalue% of VarianceCumulative % (Initial)Cumulative % (Extraction, PAF)
16,4232,1032,1030,35
22,5812,9045,0042,43
31,989,9054,9051,38
41,608,0062,9058,59
51,427,1070,0064,70
60,783,9073,90–
eigenvalue = 1 0 2 4 6 12345678910 Eigenvalue thực Parallel analysis (trung bình) Nhân tố
Scree plot minh họa: đường eigenvalue thực nằm trên đường ngẫu nhiên đến nhân tố 5 và rơi xuống dưới từ nhân tố 6, nên giữ 5 nhân tố.

Đọc ma trận xoay và hệ số tải nhân tố

Bảng cần đọc phụ thuộc phép xoay. Với Promax, đọc Pattern Matrix (hệ số tải riêng của biến lên từng nhân tố) và Factor Correlation Matrix; Structure Matrix trộn cả tương quan giữa các nhân tố nên hệ số cao hơn. Với Varimax, đọc Rotated Component Matrix (PCA) hoặc Rotated Factor Matrix (PAF). Không dùng ma trận chưa xoay (Component/Factor Matrix) để diễn giải.

Hair và cộng sự (2019) hướng dẫn: hệ số tải ±0,30 đến ±0,40 đạt mức tối thiểu để diễn giải, từ ±0,50 trở lên có ý nghĩa thực tiễn, trên ±0,70 cho thấy cấu trúc rõ ràng. Nhóm tác giả còn đưa ra ngưỡng có ý nghĩa thống kê theo cỡ mẫu (mức ý nghĩa 0,05, power 80%):

Hệ số tải tối thiểu theo cỡ mẫu (Hair và cộng sự, 2019)
Cỡ mẫu50607085100120150200250350
Hệ số tải0,750,700,650,600,550,500,450,400,350,30

Nhiều luận văn ở Việt Nam dùng chung mốc 0,50 bất kể cỡ mẫu; cách này an toàn và dễ bảo vệ.

Trích Pattern Matrix (số liệu minh họa, đã ẩn hệ số < 0,30)
BiếnF1F2F3F4F5
CL20,842
CL10,801
HL30,815
HL10,736
YD20,794
YD40,3120,655
GC10,778
HA20,731

YD4 có tải phụ 0,312 lên F2 nhưng chênh lệch với tải chính là 0,655 − 0,312 = 0,343, nên vẫn giữ được. Tương quan lớn nhất trong Factor Correlation Matrix của ví dụ là 0,52 (giữa F2 và F3), cao hơn 0,32 nên chọn Promax là hợp lý.

Xử lý biến xấu và đặt tên nhân tố

Biến tải chéo

Một biến tải lên hai nhân tố với chênh lệch hệ số dưới 0,20 (một số tác giả dùng 0,30) là ứng viên cần loại vì nó không phân biệt rõ hai khái niệm. Đây là quy ước thực hành, không phải định luật.

Nguyên tắc loại biến

  • Loại từng biến một rồi chạy lại. Ma trận thay đổi sau mỗi lần bỏ biến; tải chéo khác có thể tự hết. Thứ tự ưu tiên thường là: MSA thấp, rồi hệ số tải dưới ngưỡng, rồi tải chéo nặng nhất.
  • Biến nhảy sang nhân tố không dự kiến: kiểm tra cách diễn đạt câu hỏi, biến đảo chiều chưa mã hóa lại, hoặc khả năng hai khái niệm trùng nhau trong nhận thức người trả lời, trước khi xóa.
  • Không loại quá nhiều: thang đo còn dưới 3 biến khó đứng vững ở bước CFA.
  • Không chạy EFA riêng cho từng thang đo rồi kết luận giá trị phân biệt; giá trị phân biệt chỉ được kiểm tra khi các thang đo nằm chung một lần chạy.

Đặt tên và kiểm tra lại độ tin cậy

Nếu nhân tố gồm đúng các biến của một thang đo, giữ tên khái niệm gốc. Nếu hai thang đo gộp thành một, đặt tên mới theo các biến tải cao nhất và giải thích bằng lý thuyết. Sau khi chốt cấu trúc, tính lại Cronbach's Alpha cho từng nhân tố cuối cùng, vì tập biến đã thay đổi so với lần kiểm tra ban đầu.

Cách trình bày và checklist

Phụ lục nên có đủ bảng KMO and Bartlett's Test, Total Variance Explained, Pattern Matrix và Factor Correlation Matrix.

  • Cỡ mẫu đạt tối thiểu 5 quan sát mỗi biến, tốt hơn là 10; biến đảo chiều đã mã hóa lại.
  • Đã chọn phép trích và phép xoay có lý do (PAF + Promax nếu đi tiếp CFA/SEM) và ghi rõ trong phương pháp.
  • KMO ≥ 0,50 (tốt hơn ≥ 0,70), Bartlett Sig. < 0,05, MSA từng biến ≥ 0,50.
  • Số nhân tố được kiểm tra bằng cả eigenvalue, scree plot và parallel analysis.
  • Báo cáo Cumulative % của cột Extraction, kèm ngưỡng 50% hoặc 60% có nguồn.
  • Loại từng biến một, ghi lý do; đọc lại nội dung câu hỏi trước khi xóa.
  • Tính lại Cronbach's Alpha cho cấu trúc nhân tố cuối cùng.

Câu hỏi thường gặp

Theo Kaiser (1974), KMO từ 0,50 là mức tối thiểu chấp nhận được nhưng bị xếp loại kém; 0,60 trung bình, 0,70 khá, 0,80 rất tốt và từ 0,90 là tuyệt vời. Dưới 0,50 thì dữ liệu không phù hợp để phân tích nhân tố. Ngoài KMO tổng, hãy kiểm tra MSA từng biến trên đường chéo bảng Anti-image Correlation, biến nào dưới 0,50 nên được xem xét loại trước.
Nhiều luận văn ở Việt Nam chạy EFA riêng cho nhóm biến độc lập và riêng cho biến phụ thuộc, vì mô hình hồi quy coi chúng có vai trò khác nhau. Nếu thang đo sẽ đi tiếp sang CFA hoặc SEM, chạy chung toàn bộ biến giúp kiểm tra giá trị phân biệt giữa tất cả khái niệm. Dù chọn cách nào, hãy ghi rõ lý do trong phần phương pháp.
Trước hết kiểm tra các biến có hệ số tải và communality thấp, vì chúng kéo tổng phương sai trích xuống. Loại từng biến yếu một rồi chạy lại nếu nội dung cho phép. Xem lại số nhân tố bằng scree plot và parallel analysis. Không nên ép thêm nhân tố chỉ để vượt ngưỡng; hãy báo cáo trung thực và thảo luận hạn chế của thang đo.
Với phép xoay xiên như Promax, SPSS xuất Pattern Matrix và Structure Matrix thay cho Rotated Matrix. Bạn đọc Pattern Matrix để xem biến tải lên nhân tố nào, và Factor Correlation Matrix để biết các nhân tố tương quan bao nhiêu. Rotated Component Matrix chỉ xuất hiện khi dùng phép xoay vuông góc như Varimax.
Hệ số tải âm thường là dấu hiệu câu hỏi đảo chiều chưa được mã hóa lại, ví dụ câu "Tôi không muốn quay lại" nằm chung thang đo ý định quay lại. Hãy dùng Transform → Recode into Different Variables để đảo thang điểm rồi chạy lại EFA và Cronbach. Nếu câu hỏi không đảo chiều mà vẫn tải âm, xem lại cách diễn đạt.

Nguồn tham khảo

  1. Kaiser, H. F. (1974). An index of factorial simplicity. Psychometrika, 39(1), 31–36.
  2. Bartlett, M. S. (1954). A note on the multiplying factors for various χ² approximations. Journal of the Royal Statistical Society: Series B, 16(2), 296–298.
  3. Hair, J. F., Black, W. C., Babin, B. J., & Anderson, R. E. (2019). Multivariate data analysis (8th ed.). Cengage Learning.
  4. Horn, J. L. (1965). A rationale and test for the number of factors in factor analysis. Psychometrika, 30(2), 179–185.
  5. Costello, A. B., & Osborne, J. W. (2005). Best practices in exploratory factor analysis: Four recommendations for getting the most from your analysis. Practical Assessment, Research, and Evaluation, 10, Article 7.
  6. Gerbing, D. W., & Anderson, J. C. (1988). An updated paradigm for scale development incorporating unidimensionality and its assessment. Journal of Marketing Research, 25(2), 186–192.
  7. O'Connor, B. P. (2000). SPSS and SAS programs for determining the number of components using parallel analysis and Velicer's MAP test. Behavior Research Methods, Instruments, & Computers, 32(3), 396–402.
  8. Tabachnick, B. G., & Fidell, L. S. (2013). Using multivariate statistics (6th ed.). Pearson.
  9. Field, A. (2018). Discovering statistics using IBM SPSS Statistics (5th ed.). SAGE Publications.
  10. Nguyễn Đình Thọ. (2011). Phương pháp nghiên cứu khoa học trong kinh doanh. NXB Lao động – Xã hội.

Ngưỡng đánh giá trong bài là quy ước phổ biến trong các tài liệu trên. Hãy đối chiếu với yêu cầu của giảng viên hướng dẫn hoặc tạp chí bạn nộp bài.

100 credit cho tài khoản mới

Bắt đầu với biểu mẫu của bạn

Import, cấu hình và xem chi phí trước khi chạy.

Tạo tài khoản miễn phí