ניתוח אשכולות (Cluster Analysis)
ניתוח אשכולות הוא שיטה לחלוקת נבדקים לקבוצות הומוגניות על סמך דמיון ביניהם. בניגוד לניתוחים המשווים בין קבוצות ידועות מראש, כאן הקבוצות אינן ידועות והן עצמן התוצר של הניתוח. השיטה מאפשרת לזהות טיפוסים או פרופילים בתוך אוכלוסייה.
תוכן עניינים
- מה זה ניתוח אשכולות
- מתי משתמשים בניתוח אשכולות
- איך מבצעים ניתוח אשכולות ב-SPSS, שלב אחר שלב
- איך קוראים את התוצאות
- איך מדווחים על התוצאות לפי APA
מה זה ניתוח אשכולות
הרעיון פשוט: לחלק את הנבדקים לקבוצות כך שהדמיון בתוך כל קבוצה יהיה מרבי והשוני בין הקבוצות יהיה מרבי. הדמיון נמדד באמצעות מדד מרחק, ובדרך כלל משתמשים במרחק אוקלידי, שהוא הכללה של משפט פיתגורס למרחב רב-ממדי:
\[ d(A,B) = \sqrt{\sum_{i=1}^{p} (x_{Ai} – x_{Bi})^2} \]
שתי משפחות עיקריות של שיטות משמשות בפועל.
אשכול היררכי
השיטה מתחילה במצב שבו כל נבדק הוא אשכול בפני עצמו, ובכל שלב מאחדת את שני האשכולות הקרובים ביותר, עד שכולם מאוחדים לאשכול אחד. התוצר הגרפי נקרא דנדוגרם, והוא עץ המתאר את סדר האיחודים. החוקר בוחר בדיעבד היכן לחתוך את העץ, וכך קובע את מספר האשכולות. השיטה מתאימה למדגמים קטנים, עד כמה מאות נבדקים, ויתרונה בכך שאינה דורשת קביעה מוקדמת של מספר האשכולות.
אשכול K ממוצעים
כאן החוקר קובע מראש את מספר האשכולות, והאלגוריתם מחלק את הנבדקים בתהליך איטרטיבי: הוא מציב מרכזים ראשוניים, משייך כל נבדק למרכז הקרוב אליו, מחשב מחדש את המרכזים לפי הממוצעים שהתקבלו, וחוזר על התהליך עד להתייצבות. השיטה יעילה גם במדגמים גדולים מאוד, וחסרונה בצורך לקבוע מראש את מספר האשכולות.
נוהג מקובל הוא לשלב בין השתיים: מריצים אשכול היררכי על מדגם משנה כדי לקבל אומדן למספר האשכולות, ואז מריצים K ממוצעים על המדגם המלא עם המספר שהתקבל.
נקודה שחשוב להפנים: ניתוח אשכולות תמיד יפיק חלוקה. גם בנתונים אקראיים לחלוטין תתקבל חלוקה לשלוש קבוצות אם ביקשתם שלוש. הפרשנות והתיקוף הם באחריות החוקר, ואינם מובטחים על ידי השיטה.
מתי משתמשים בניתוח אשכולות
זיהוי טיפוסים או פרופילים
חוקרת מודדת שלושה ממדים של סגנון התמודדות אצל מטופלים, ומבקשת לדעת האם קיימים ביניהם טיפוסים נבדלים. הניתוח יחלק אותם לקבוצות ויאפשר לתאר כל טיפוס.
פילוח שוק ואוכלוסיות
חלוקת לקוחות לקבוצות לפי דפוסי צריכה, לצורך התאמת מסרים או שירותים.
יצירת משתנה קטגוריאלי חדש
לאחר הניתוח, השיוך לאשכול נשמר כמשתנה בקובץ, ואפשר להשתמש בו בניתוחים נוספים: השוואה בין האשכולות במשתנים שלא נכללו בחלוקה, למשל באמצעות ניתוח שונות או מבחן חי בריבוע. זהו למעשה שלב התיקוף החשוב ביותר.
ההבדל מניתוח גורמים
הבדל שכיח לבלבול: ניתוח גורמים מקבץ משתנים, ואילו ניתוח אשכולות מקבץ נבדקים. הראשון עונה על השאלה אילו פריטים הולכים יחד, השני על השאלה אילו אנשים דומים זה לזה.
תנאים והנחות
- תקנון המשתנים. זהו התנאי הקריטי ביותר. מדד המרחק רגיש לסולם המדידה, ולכן משתנה שנע בין 0 ל-100 ישתלט על החלוקה לעומת משתנה שנע בין 1 ל-5. יש לתקנן את כל המשתנים לציוני תקן לפני הניתוח.
- משתנים רציפים. מרחק אוקלידי מתאים למשתנים רציפים. לנתונים קטגוריאליים או מעורבים יש להשתמש ב-Two-Step Cluster.
- היעדר משתנים חופפים. משתנים מתואמים מאוד מקבלים למעשה משקל כפול בחישוב המרחק. אפשר לצמצם אותם קודם באמצעות ניתוח רכיבים עיקריים.
- רגישות לחריגים. תצפית קיצונית עלולה ליצור אשכול בן נבדק אחד או לעוות את המרכזים. יש לאתר חריגים מראש.
- מספר משתנים מצומצם. חלוקה על סמך שלושה עד שמונה משתנים ברורה ופרשנית הרבה יותר מחלוקה על סמך שלושים.
איך מבצעים ניתוח אשכולות ב-SPSS, שלב אחר שלב
שלב מקדים, תקנון
- בחרו Analyze, ואז Descriptive Statistics, ואז Descriptives.
- העבירו את כל המשתנים שישמשו בניתוח.
- סמנו את התיבה Save standardized values as variables ולחצו OK. בקובץ ייווצרו עמודות חדשות בעלות קידומת Z, ובהן יש להשתמש בניתוח.
אשכול היררכי
- בחרו Analyze, ואז Classify, ואז Hierarchical Cluster.
- העבירו את המשתנים המתוקננים לתיבה Variable(s). תחת Cluster ודאו שנבחר Cases.
- לחצו על Method. בתפריט Cluster Method בחרו Ward's method, שהיא השיטה המקובלת ביותר במחקר החברתי ונוטה ליצור אשכולות בגודל דומה. תחת Measure ודאו שנבחר Squared Euclidean distance. אם לא תקננתם מראש, אפשר לתקנן כאן דרך Transform Values ובחירת Z scores.
- לחצו על Plots וסמנו Dendrogram.
- לחצו על Statistics וסמנו Agglomeration schedule, ותחת Cluster Membership בחרו Range of solutions והזינו טווח, למשל מ-2 עד 5. כך תקבלו עמודת שיוך לכל פתרון.
- לחצו OK.
אשכול K ממוצעים
- בחרו Analyze, ואז Classify, ואז K-Means Cluster.
- העבירו את המשתנים המתוקננים לתיבה Variables.
- בשדה Number of Clusters הזינו את המספר שהחלטתם עליו.
- לחצו על Iterate והגדילו את מספר האיטרציות ל-25 לפחות.
- לחצו על Save וסמנו Cluster membership ו-Distance from cluster center.
- לחצו על Options וסמנו Initial cluster centers ו-ANOVA table.
- לחצו OK.
סינטקס
DESCRIPTIVES VARIABLES=Coping1 Coping2 Coping3 /SAVE. CLUSTER ZCoping1 ZCoping2 ZCoping3 /METHOD WARD /MEASURE=SEUCLID /PRINT SCHEDULE CLUSTER(2,5) /PLOT DENDROGRAM. QUICK CLUSTER ZCoping1 ZCoping2 ZCoping3 /MISSING=LISTWISE /CRITERIA=CLUSTER(3) MXITER(25) CONVERGE(0) /METHOD=KMEANS(NOUPDATE) /SAVE CLUSTER DISTANCE /PRINT INITIAL ANOVA CLUSTER DISTAN.
איך קוראים את התוצאות
הדנדוגרם
הדנדוגרם הוא עץ שבו הנבדקים מופיעים בצד אחד וקווים מחברים ביניהם. ככל שהאיחוד מתרחש רחוק יותר לאורך הציר, כך האשכולות שאוחדו רחוקים יותר זה מזה. הקריאה המעשית: מחפשים את הקפיצה הגדולה ביותר לאורך הציר, ומעבירים קו חיתוך אנכי לפניה. מספר הקווים שהקו חוצה הוא מספר האשכולות המומלץ.
לוח האיחודים
הטבלה Agglomeration Schedule מציגה את מקדם המרחק בכל שלב.
| Stage | Coefficient | Change | Clusters remaining |
|---|---|---|---|
| 145 | 112.4 | 5 | |
| 146 | 128.7 | 16.3 | 4 |
| 147 | 147.2 | 18.5 | 3 |
| 148 | 212.8 | 65.6 | 2 |
| 149 | 298.0 | 85.2 | 1 |
מחפשים את הקפיצה הגדולה בעמודת השינוי. כאן הקפיצה הגדולה מתרחשת במעבר משלושה אשכולות לשניים, ולכן הפתרון המומלץ הוא שלושה אשכולות. הכלל: עוצרים בשלב שלפני הקפיצה.
מרכזי האשכולות הסופיים
זוהי הטבלה החשובה ביותר לפרשנות, והיא מופיעה בפלט של K ממוצעים.
| Variable | Cluster 1 | Cluster 2 | Cluster 3 |
|---|---|---|---|
| ZCoping1 (problem focused) | 1.02 | -0.88 | 0.14 |
| ZCoping2 (emotion focused) | -0.74 | 0.94 | 0.21 |
| ZCoping3 (avoidance) | -0.65 | 0.81 | -0.32 |
מכיוון שהמשתנים מתוקננים, הפרשנות ישירה: ערך חיובי פירושו מעל הממוצע הכללי, שלילי מתחתיו. האשכול הראשון גבוה בהתמודדות ממוקדת בעיה ונמוך בשאר, ולכן אפשר לכנותו מתמודדים אקטיביים. השני הפוך, ואפשר לכנותו מתמודדים רגשיים ונמנעים. השלישי קרוב לממוצע בכל המדדים, ואפשר לכנותו טיפוס מעורב. מתן שמות תוכניים לאשכולות הוא חלק מהותי מהניתוח.
מספר הנבדקים בכל אשכול
| Cluster | N |
|---|---|
| 1 | 68 |
| 2 | 54 |
| 3 | 91 |
| Valid | 213 |
פתרון שבו אשכול אחד מכיל שלושה נבדקים ואחר מכיל מאתיים הוא בדרך כלל סימן לבעיה, ולרוב מקורו בתצפיות חריגות. פתרון מאוזן יחסית, כמו בדוגמה, אמין יותר.
טבלת ANOVA
הטבלה שמפיק K ממוצעים מציגה מבחן F לכל משתנה. חשוב להבין את מגבלתה: המבחנים האלה תמיד יצאו מובהקים, משום שהאשכולות נוצרו במפורש כדי למקסם את ההבדלים במשתנים האלה. אין לדווח עליהם כעדות סטטיסטית. הם שימושיים רק לצורך השוואה יחסית, כדי לדעת איזה משתנה תרם יותר לחלוקה.
תיקוף אמיתי של הפתרון
התיקוף הנכון נעשה במשתנים שלא נכללו בחלוקה. אם האשכולות שנמצאו נבדלים זה מזה גם ברמת הדיכאון, בשביעות רצון מהחיים או במשתנים דמוגרפיים, יש לכך משמעות מהותית. בדיקה זו נעשית באמצעות ניתוח שונות או מבחן חי בריבוע רגילים.
איך מדווחים על התוצאות לפי APA
נוסח לדוגמה
"לזיהוי פרופילים של סגנונות התמודדות נערך ניתוח אשכולות. כל המשתנים תוקננו לציוני תקן לפני הניתוח. בשלב הראשון נערך אשכול היררכי בשיטת Ward עם מרחק אוקלידי בריבוע. בחינת הדנדוגרם ולוח האיחודים העלתה קפיצה משמעותית במקדם במעבר משלושה אשכולות לשניים, ולפיכך נבחר פתרון בן שלושה אשכולות. בשלב השני נערך אשכול K ממוצעים עם שלושה אשכולות. האשכול הראשון (n = 68, 31.9%) התאפיין ברמה גבוהה של התמודדות ממוקדת בעיה (Z = 1.02) וברמות נמוכות של התמודדות רגשית (Z = -0.74) והימנעות (Z = -0.65), וכונה מתמודדים אקטיביים. האשכול השני (n = 54, 25.4%) הראה דפוס הפוך וכונה מתמודדים נמנעים. האשכול השלישי (n = 91, 42.7%) הראה ערכים סמוכים לממוצע בכל המדדים וכונה טיפוס מעורב. לתיקוף החלוקה נערכו ניתוחי שונות במשתנים שלא נכללו בה, ונמצא הבדל מובהק בין האשכולות ברמת המצוקה הנפשית, F(2, 210) = 14.28, p < .001, η²p = .12."
טבלה לדוגמה
טבלה 1: מרכזי האשכולות בציוני תקן ומאפייני האשכולות
| משתנה | אשכול 1: אקטיביים (n = 68) | אשכול 2: נמנעים (n = 54) | אשכול 3: מעורב (n = 91) |
|---|---|---|---|
| התמודדות ממוקדת בעיה | 1.02 | -0.88 | 0.14 |
| התמודדות ממוקדת רגש | -0.74 | 0.94 | 0.21 |
| הימנעות | -0.65 | 0.81 | -0.32 |
| מצוקה נפשית (משתנה תיקוף) | 2.14 (0.68) | 3.42 (0.74) | 2.81 (0.71) |
הערה מתחת לטבלה: "N = 213. שלוש השורות הראשונות בציוני תקן, השורה האחרונה בממוצעים גולמיים וסטיות תקן."
לצמצום מספר המשתנים לפני האשכול ראו ניתוח רכיבים עיקריים, ולהשוואה בין האשכולות שנוצרו ראו ניתוח שונות רב-משתני.