שירותים לחוקרים
באקדמיה

ניתוח רכיבים עיקריים (PCA)

ניתוח רכיבים עיקריים, המוכר בשמו הלועזי Principal Component Analysis, הוא שיטה להפחתת ממדים. הוא לוקח אוסף גדול של משתנים מתואמים והופך אותם למספר קטן של רכיבים חדשים, בלתי מתואמים זה בזה, המסבירים את החלק הגדול ביותר האפשרי מהשונות בנתונים המקוריים.

תוכן עניינים

מה זה ניתוח רכיבים עיקריים

דמיינו אוסף של עשרים משתנים מתואמים. חלק גדול מהמידע שבהם חופף, שכן משתנים מתואמים מספרים סיפור דומה. ניתוח רכיבים עיקריים מחפש כיוון חדש במרחב הנתונים, כלומר צירוף ליניארי של כל המשתנים, שלאורכו הפיזור הוא הגדול ביותר האפשרי. זהו הרכיב הראשון. לאחר מכן הוא מחפש כיוון נוסף, הניצב לראשון ולכן בלתי מתואם בו, שלאורכו הפיזור הנותר הוא הגדול ביותר. זהו הרכיב השני, וכן הלאה.

כל רכיב הוא צירוף משוקלל של המשתנים המקוריים:

\[ C_1 = w_{11}X_1 + w_{12}X_2 + \dots + w_{1p}X_p \]

שימו לב לכיוון החץ, והוא ההבדל המהותי מניתוח גורמים מגשש. בניתוח גורמים ההנחה היא שהגורם הסמוי הוא הגורם למתאמים בין הפריטים, כלומר החץ מהגורם אל הפריטים. בניתוח רכיבים אין הנחה סיבתית כלל: הרכיב הוא פשוט סיכום מתמטי של המשתנים, והחץ מהמשתנים אל הרכיב.

מכאן נגזרת הבחירה בין השיטות. אם השאלה שלכם היא תיאורטית, כלומר איזה מבנה סמוי מסביר את התשובות, השיטה הנכונה היא ניתוח גורמים. אם השאלה שלכם היא מעשית, כלומר איך לצמצם עשרים משתנים לשלושה מדדים מבלי לאבד מידע, השיטה הנכונה היא ניתוח רכיבים. הבדל טכני נוסף: ניתוח רכיבים מנתח את השונות הכוללת של כל משתנה ומניח שכל השונות ניתנת להסבר, ואילו ניתוח גורמים מפריד בין שונות משותפת לשונות ייחודית הכוללת שגיאת מדידה.

בפועל, כאשר המשתנים מתואמים היטב ומספרם גדול, שתי השיטות מניבות תוצאות דומות מאוד. ההבדלים בולטים כאשר מספר המשתנים קטן או כאשר המתאמים בינוניים.

מתי משתמשים בניתוח רכיבים עיקריים

הפחתת ממדים לפני ניתוח נוסף

זהו השימוש המובהק. יש בידינו עשרים משתנים מתואמים שאותם ברצוננו להכניס לרגרסיה מרובה, אך המתאמים ביניהם ייצרו רב-קוליניאריות חמורה. הפיכתם לשלושה רכיבים בלתי מתואמים פותרת את הבעיה.

יצירת מדד מסכם

כאשר רוצים לבנות מדד יחיד מתוך כמה אינדיקטורים, למשל מדד מעמד חברתי-כלכלי מתוך הכנסה, השכלה ותעסוקה. הרכיב הראשון משמש כמדד, והמשקלים נקבעים לפי הנתונים ולא באופן שרירותי.

הצגה גרפית של נתונים רב-ממדיים

שני הרכיבים הראשונים מאפשרים לשרטט את הנבדקים על מישור דו-ממדי ולראות דפוסים ואשכולות. זהו שלב מקדים שכיח לפני ניתוח אשכולות.

ניקוי רעש

שמירה על הרכיבים הראשונים בלבד והשלכת האחרונים מסננת את החלק האקראי שבנתונים ומשאירה את המבנה השיטתי.

תנאים והנחות

  • משתנים רציפים או סדרתיים בעלי מספר דרגות סביר.
  • קשרים ליניאריים בין המשתנים. השיטה מבוססת כולה על מטריצת המתאמים, ולכן קשרים לא ליניאריים אינם נתפסים.
  • מתאמים מספיקים. אם המשתנים אינם מתואמים כלל, אין מה לצמצם. נבדק במדד KMO ובמבחן ברטלט.
  • גודל מדגם. לפחות חמישה נבדקים לכל משתנה, ורצוי הרבה יותר.
  • רגישות לסולם המדידה. משתנה בעל שונות גדולה ישתלט על הרכיב הראשון. הפתרון הוא ניתוח מטריצת המתאמים ולא מטריצת השונויות, וזוהי ברירת המחדל ב-SPSS.
  • רגישות לחריגים. ערכים קיצוניים משפיעים על הכיוונים שיימצאו, ולכן כדאי לאתרם מראש.

איך מבצעים ניתוח רכיבים עיקריים ב-SPSS, שלב אחר שלב

הניתוח מבוצע באותו חלון של ניתוח גורמים, וההבדל הוא בבחירת שיטת החילוץ.

  1. בחרו Analyze, ואז Dimension Reduction, ואז Factor.
  2. העבירו את כל המשתנים לתיבה Variables.
  3. לחצו על Descriptives וסמנו Initial solution, Coefficients ו-KMO and Bartlett's test of sphericity.
  4. לחצו על Extraction. ודאו שבתפריט Method נבחר Principal components, שהיא ברירת המחדל של SPSS. תחת Analyze השאירו Correlation matrix. סמנו Scree plot. תחת Extract בחרו Based on Eigenvalue greater than 1 בהרצה הראשונה.
  5. לחצו על Rotation. אם מטרתכם היא ליצור רכיבים בלתי מתואמים לשימוש בניתוח המשך, בחרו Varimax או השאירו ללא סיבוב. סמנו Rotated solution.
  6. לחצו על Scores וסמנו Save as variables בשיטת Regression. כך יתווספו לקובץ עמודות חדשות של ציוני הרכיבים, שאותן אפשר להשתמש בניתוחים הבאים. סמנו גם Display factor score coefficient matrix.
  7. לחצו על Options וסמנו Sorted by size ו-Suppress small coefficients עם ערך 0.30.
  8. לחצו OK.
ad

סינטקס

FACTOR
  /VARIABLES V1 TO V20
  /MISSING LISTWISE
  /ANALYSIS V1 TO V20
  /PRINT INITIAL CORRELATION KMO EXTRACTION ROTATION FSCORE
  /FORMAT SORT BLANK(.30)
  /PLOT EIGEN
  /CRITERIA MINEIGEN(1) ITERATE(25)
  /EXTRACTION PC
  /ROTATION VARIMAX
  /SAVE REG(ALL)
  /METHOD=CORRELATION.

חילוץ מספר רכיבים קבוע, למשל שלושה:

FACTOR
  /VARIABLES V1 TO V20
  /PRINT EXTRACTION ROTATION
  /FORMAT SORT BLANK(.30)
  /CRITERIA FACTORS(3) ITERATE(25)
  /EXTRACTION PC
  /ROTATION VARIMAX
  /SAVE REG(ALL).

איך קוראים את התוצאות

טבלת השיתופיות

Variable Initial Extraction
V1 1.000 .712
V2 1.000 .684
V3 1.000 .298

שימו לב שהערך ההתחלתי הוא תמיד 1, וזהו הביטוי המספרי להנחה שכל השונות ניתנת להסבר. עמודת Extraction מלמדת איזה חלק מהשונות בכל משתנה נשמר לאחר הצמצום. המשתנה השלישי בדוגמה שומר פחות משלושים אחוזים, ולכן הוא מיוצג בצורה גרועה בפתרון ואפשר לשקול את הסרתו.

טבלת השונות המוסברת

Component Eigenvalue % of Variance Cumulative %
1 6.42 32.1 32.1
2 3.28 16.4 48.5
3 2.14 10.7 59.2
4 0.98 4.9 64.1
5 0.81 4.1 68.2

שלושה רכיבים בעלי ערך עצמי גדול מ-1, המסבירים יחד 59.2 אחוזים מהשונות. כלומר, במקום עשרים משתנים אפשר להסתפק בשלושה, במחיר של אובדן ארבעים אחוזים מהמידע. שיעור מקובל בספרות הוא לפחות שישים אחוזים, אך הדבר תלוי בתחום.

קריטריון הערך העצמי הגדול מאחד ידוע כנוטה לחלץ יותר מדי רכיבים. שלוש דרכים נוספות להחלטה: תרשים הסקרי ונקודת המרפק שבו, קריטריון של אחוז שונות מצטבר מינימלי, ושיטת הניתוח המקבילה של הורן, המשווה את הערכים העצמיים לאלה שהיו מתקבלים בנתונים אקראיים בעלי אותו גודל.

מטריצת הרכיבים המסובבת

Variable Component 1 Component 2 Component 3
V8 .842
V4 .798
V12 .756
V1 .821
V6 .774
V17 .788
V10 .731

הקריאה זהה לזו של ניתוח גורמים: כל משתנה משויך לרכיב שעליו הוא נטען חזק. משתנה הנטען על שני רכיבים בעוצמה דומה מקשה על הפרשנות. אם המטרה היא הפחתת ממדים בלבד ולא פרשנות, הבעיה הזו פחות חמורה.

ציוני הרכיבים

העמודות החדשות שנוספו לקובץ מכילות ציוני תקן, כלומר ממוצע אפס וסטיית תקן אחת. ערך חיובי פירושו שהנבדק גבוה מהממוצע ברכיב, וערך שלילי שהוא נמוך ממנו. הציונים בלתי מתואמים לחלוטין זה בזה, וזוהי תכונה שימושית מאוד בניתוחים הבאים.

מתי הפתרון אינו טוב

Value
KMO .487
Bartlett's Sig. .213

מדד KMO נמוך מ-0.50 ומבחן ברטלט אינו מובהק. פירוש הדבר שהמשתנים אינם מתואמים מספיק ואין הצדקה לצמצום. במקרה כזה אין להמשיך בניתוח.

איך מדווחים על התוצאות לפי APA

נוסח לדוגמה

"לצורך הפחתת ממדים נערך ניתוח רכיבים עיקריים על עשרים המשתנים, עם סיבוב Varimax. הנתונים נמצאו מתאימים לניתוח: מדד KMO היה .86, ומבחן הכדוריות של ברטלט נמצא מובהק, χ²(190) = 2143.77, p < .001. שלושה רכיבים בעלי ערך עצמי גדול מ-1 חולצו, בהתאם גם לנקודת המרפק בתרשים הסקרי, והם הסבירו יחד 59.2% מהשונות. הרכיב הראשון הסביר 32.1% מהשונות וכלל שבעה משתנים בטעינות של .61 עד .84. הרכיב השני הסביר 16.4% וכלל שישה משתנים בטעינות של .58 עד .82. הרכיב השלישי הסביר 10.7% וכלל חמישה משתנים בטעינות של .55 עד .79. ציוני הרכיבים נשמרו בשיטת רגרסיה ושימשו כמשתני ניבוי בניתוחים שלהלן."

נוסח לדוגמה, נתונים שאינם מתאימים

"מדד KMO היה .49 ומבחן הכדוריות של ברטלט לא נמצא מובהק, p = .213, ולפיכך הנתונים לא נמצאו מתאימים לניתוח רכיבים עיקריים, והמשתנים נותחו בנפרד."

טבלה לדוגמה

טבלה 1: טעינות הרכיבים לאחר סיבוב Varimax

משתנה רכיב 1 רכיב 2 רכיב 3 שיתופיות
משתנה 8 .84 .74
משתנה 4 .80 .69
משתנה 12 .76 .62
משתנה 1 .82 .71
משתנה 6 .77 .65
משתנה 17 .79 .66
משתנה 10 .73 .58
ערך עצמי 6.42 3.28 2.14
אחוז שונות 32.1 16.4 10.7

הערה מתחת לטבלה: "N = 280. טעינות הנמוכות מ-.30 הושמטו."

להבדל המושגי בין השיטות ראו ניתוח גורמים מגשש, ולשימוש בציוני הרכיבים לצורך חלוקת נבדקים לקבוצות ראו ניתוח אשכולות.