רגרסיית פואסון (Poisson Regression)
רגרסיית פואסון היא מודל המיועד למשתני תלות המבטאים ספירות, כלומר מספר פעמים שאירוע כלשהו התרחש: מספר היעדרויות, מספר פניות למרפאה, מספר טעויות במבחן, מספר תאונות. משתנים כאלה אינם מתפלגים נורמלית ואינם מתאימים לרגרסיה ליניארית רגילה.
תוכן עניינים
- מה זה רגרסיית פואסון
- מתי משתמשים ברגרסיית פואסון
- איך מבצעים רגרסיית פואסון ב-SPSS, שלב אחר שלב
- איך קוראים את התוצאות
- איך מדווחים על התוצאות לפי APA
מה זה רגרסיית פואסון
משתנה ספירה הוא משתנה מיוחד. הוא אינו יכול לקבל ערכים שליליים, הוא מקבל רק ערכים שלמים, והתפלגותו כמעט תמיד מוטה ימינה: רוב הנבדקים מרוכזים בערכים נמוכים ומיעוט קטן מגיע לערכים גבוהים. שימוש ברגרסיה ליניארית על משתנה כזה מוביל לשתי בעיות: המודל עלול לנבא ערכים שליליים חסרי משמעות, והנחות הנורמליות וההומוסקדסטיות מופרות באופן שיטתי.
רגרסיית פואסון פותרת את הבעיה בכך שהיא מניחה שהמשתנה התלוי מתפלג לפי התפלגות פואסון, ומקשרת בינו לבין המנבאים באמצעות פונקציית קישור לוגריתמית:
\[ \ln(\lambda) = b_0 + b_1X_1 + b_2X_2 + \dots + b_kX_k \]
כאשר \(\lambda\) הוא מספר האירועים הצפוי. מכיוון שהלוגריתם הוא שנחזה, המספר הצפוי עצמו מתקבל מהעלאה בחזקה, ולכן הוא תמיד חיובי. את המקדמים מפרשים לאחר העלאה בחזקה, ואז הם מקבלים משמעות של יחס שיעורים.
הפרשנות היא מכפילה ולא חיבורית. אם מקדם מסוים לאחר העלאה בחזקה שווה ל-1.35, פירוש הדבר שעלייה של יחידה אחת במנבא מגדילה את מספר האירועים הצפוי בשלושים וחמישה אחוזים. ערך של 1 פירושו היעדר השפעה, ערך הקטן מ-1 פירושו הפחתה.
בעיית הפיזור היתר
להתפלגות פואסון תכונה מגבילה: היא מניחה שהשונות שווה לתוחלת. בנתונים אמיתיים ההנחה הזו מופרת לעתים קרובות, והשונות גדולה מהתוחלת. התופעה נקראת פיזור יתר, ובאנגלית overdispersion, והתעלמות ממנה גורמת לשגיאות תקן קטנות מדי ולתוצאות מובהקות באופן מלאכותי. הפתרון המקובל הוא מעבר לרגרסיה בינומית שלילית, המודל שנועד בדיוק למצב הזה, או שימוש בשגיאות תקן חסינות.
מתי משתמשים ברגרסיית פואסון
התנאי המרכזי הוא אופיו של המשתנה התלוי. הוא צריך להיות מספר שלם ולא שלילי המבטא ספירת אירועים בפרק זמן או במרחב מוגדר. משתני הניבוי יכולים להיות רציפים או קטגוריאליים, ללא הגבלה.
דוגמאות
מספר היעדרויות מהעבודה. חוקרת בודקת האם עומס, תמיכה ותפקיד מנבאים את מספר ימי ההיעדרות בשנה. רוב העובדים נעדרו בין אפס לשלושה ימים, ומיעוט נעדר עשרות ימים.
מספר פניות לשירות. מחקר הבוחן כמה פעמים פנו מטופלים לחדר מיון בשנה, כפונקציה של גיל, מצב בריאותי ומרחק מהמרפאה.
מספר טעויות או אירועים חריגים. ספירת שגיאות בביצוע משימה, מספר תאונות בצומת, מספר הפרות בטיחות במפעל.
מספר התנהגויות שנצפו. כמה פעמים ילד יזם אינטראקציה חברתית בשעת התצפית.
שיעורים וחשיפה לא אחידה
לעתים קרובות הנבדקים אינם נצפים לאותו פרק זמן. עובד אחד הועסק שנה שלמה ואחר חצי שנה, ולכן השוואה ישירה של מספר ההיעדרויות מוטה. הפתרון הוא הכנסת משתנה חשיפה, המכונה offset. המודל מנתח אז שיעור לכל יחידת זמן ולא ספירה גולמית. המשתנה נכנס למודל בצורת לוגריתם שלו, ובדרך כלל התוכנה מבצעת את ההמרה בעצמה.
מתי לא להשתמש
- כאשר המשתנה התלוי רציף ולא ספירה, יש להשתמש ברגרסיה מרובה.
- כאשר המשתנה דיכוטומי, כלומר קרה או לא קרה, יש להשתמש ברגרסיה לוגיסטית.
- כאשר יש עודף גדול של אפסים, הרבה מעבר לצפוי, מודלים ייעודיים כמו Zero-Inflated Poisson מתאימים יותר.
- כאשר קיים פיזור יתר משמעותי, מודל בינומי שלילי עדיף.
איך מבצעים רגרסיית פואסון ב-SPSS, שלב אחר שלב
הניתוח אינו נמצא בתפריט הרגרסיה הרגיל אלא במודול המודלים הליניאריים המוכללים.
- בחרו Analyze, ואז Generalized Linear Models, ואז שוב Generalized Linear Models.
- בלשונית Type of Model בחרו באפשרות Poisson loglinear תחת Counts. אם אתם מתכננים מודל בינומי שלילי, בחרו Negative binomial with log link.
- עברו ללשונית Response. העבירו את משתנה הספירה לתיבה Dependent Variable. אם יש משתנה חשיפה, לחצו על Variable תחת Offset והעבירו אותו לשם. חשוב: אם המשתנה שברשותכם הוא הזמן עצמו ולא הלוגריתם שלו, צרו תחילה משתנה חדש בעזרת פונקציית LN.
- עברו ללשונית Predictors. העבירו משתנים קטגוריאליים לתיבה Factors ומשתנים רציפים לתיבה Covariates. את קטגוריית הייחוס אפשר לקבוע דרך כפתור Options שבאותה לשונית.
- עברו ללשונית Model והעבירו את כל המנבאים לתיבה Model. אפשר לבנות כאן גם אינטראקציות.
- בלשונית Estimation אפשר לבחור Robust estimator תחת Covariance Matrix, וזוהי בחירה מומלצת כאשר קיים חשד לפיזור יתר.
- עברו ללשונית Statistics וסמנו Include exponential parameter estimates. בלי הסימון הזה תקבלו רק מקדמים לוגריתמיים שקשה לפרש. סמנו גם Analysis type: Type III.
- בלשונית Save אפשר לשמור ערכים חזויים ושאריות פירסון, שיסייעו בבדיקת התאמת המודל.
- לחצו OK.
סינטקס
GENLIN Absences BY Department (ORDER=ASCENDING)
WITH Workload Support
/MODEL Department Workload Support
INTERCEPT=YES
DISTRIBUTION=POISSON LINK=LOG
/CRITERIA METHOD=FISHER(1) SCALE=1 COVB=MODEL
PCONVERGE=1E-006(ABSOLUTE) SINGULAR=1E-012 ANALYSISTYPE=3
CILEVEL=95 CITYPE=WALD LIKELIHOOD=FULL
/PRINT CPS DESCRIPTIVES MODELINFO FIT SUMMARY SOLUTION (EXPONENTIATED).
מודל עם משתנה חשיפה ועם שגיאות תקן חסינות:
COMPUTE LnMonths = LN(MonthsEmployed).
EXECUTE.
GENLIN Absences BY Department WITH Workload
/MODEL Department Workload
INTERCEPT=YES OFFSET=LnMonths
DISTRIBUTION=POISSON LINK=LOG
/CRITERIA COVB=ROBUST ANALYSISTYPE=3
/PRINT FIT SUMMARY SOLUTION (EXPONENTIATED).
איך קוראים את התוצאות
טבלת התאמת המודל
הטבלה Goodness of Fit היא הראשונה שיש לבדוק, והיא זו שמגלה פיזור יתר.
| Value | df | Value/df | |
|---|---|---|---|
| Deviance | 168.42 | 146 | 1.15 |
| Pearson Chi-Square | 159.87 | 146 | 1.09 |
| Log Likelihood | -312.44 | ||
| Akaike's Information Criterion (AIC) | 634.88 |
העמודה הקריטית היא Value/df. ערך קרוב ל-1, כמו כאן, מעיד על התאמה טובה ועל היעדר פיזור יתר. ערך הגדול מ-1.5 בקירוב מסמן פיזור יתר ומחייב מעבר למודל בינומי שלילי. ערך קטן מ-1 מסמן תת-פיזור, תופעה נדירה יותר.
טבלת מבחני האפקטים
| Source | Wald Chi-Square | df | Sig. |
|---|---|---|---|
| (Intercept) | 42.18 | 1 | <.001 |
| Department | 11.42 | 2 | .003 |
| Workload | 18.76 | 1 | <.001 |
| Support | 2.14 | 1 | .143 |
הטבלה מלמדת אילו מנבאים תורמים למודל. עבור משתנה קטגוריאלי בעל שלוש קטגוריות זהו המבחן הכולל, עם שתי דרגות חופש.
טבלת המקדמים
זוהי הטבלה שממנה מדווחים.
| Parameter | B | SE | Wald χ² | Sig. | Exp(B) | 95% CI for Exp(B) |
|---|---|---|---|---|---|---|
| (Intercept) | 0.482 | 0.187 | 6.65 | .010 | 1.62 | [1.12, 2.34] |
| Workload | 0.301 | 0.070 | 18.76 | <.001 | 1.35 | [1.18, 1.55] |
| Support | -0.089 | 0.061 | 2.14 | .143 | 0.91 | [0.81, 1.03] |
| Department = A | 0.412 | 0.134 | 9.45 | .002 | 1.51 | [1.16, 1.96] |
| Department = B | 0.105 | 0.141 | 0.56 | .456 | 1.11 | [0.84, 1.46] |
הפרשנות נעשית תמיד דרך עמודת Exp(B). עלייה של יחידה בעומס העבודה מנבאת עלייה של 35 אחוזים במספר ההיעדרויות הצפוי. במחלקה A מספר ההיעדרויות הצפוי גבוה ב-51 אחוזים לעומת מחלקת הייחוס. התמיכה החברתית אינה מנבא מובהק, ובהתאם לכך רווח בר הסמך שלה כולל את הערך 1. שימו לב לכלל הזה: ברגרסיות שבהן מדווחים יחסים, ערך הניטרליות הוא 1 ולא 0.
איך נראה מודל עם פיזור יתר
| Value | df | Value/df | |
|---|---|---|---|
| Deviance | 412.66 | 146 | 2.83 |
ערך של 2.83 מעיד על פיזור יתר ניכר. הרצה חוזרת במודל בינומי שלילי, והשוואת ערכי AIC בין שני המודלים, תראה בדרך כלל ירידה משמעותית ב-AIC, שהיא הסימן לכך שהמודל השני מתאים יותר.
איך מדווחים על התוצאות לפי APA
מדווחים על סוג המודל, על בדיקת הפיזור, על מבחני האפקטים ועל המקדמים המועלים בחזקה עם רווחי בר סמך.
נוסח לדוגמה, תוצאה מובהקת
"מאחר שהמשתנה התלוי מבטא ספירת אירועים, נערכה רגרסיית פואסון עם פונקציית קישור לוגריתמית. יחס הסטייה לדרגות החופש היה 1.15, ולפיכך לא נמצאה עדות לפיזור יתר. המודל כולו נמצא מובהק, χ²(4) = 38.21, p < .001. עומס העבודה נמצא מנבא מובהק של מספר ההיעדרויות, B = 0.30, SE = 0.07, Wald χ²(1) = 18.76, p < .001, Exp(B) = 1.35, 95% CI [1.18, 1.55], כלומר עלייה של יחידה אחת בעומס העבודה קשורה לעלייה של 35% במספר ההיעדרויות הצפוי. התמיכה החברתית לא נמצאה מנבא מובהק, Exp(B) = 0.91, 95% CI [0.81, 1.03], p = .143."
נוסח לדוגמה, מעבר למודל בינומי שלילי
"בדיקה ראשונית העלתה פיזור יתר ניכר, יחס סטייה לדרגות חופש של 2.83, ולפיכך נאמד מודל בינומי שלילי. מדד AIC ירד מ-892.4 במודל הפואסוני ל-701.8 במודל הבינומי השלילי, ולכן דווחו תוצאות המודל השני."
טבלה לדוגמה
טבלה 1: תוצאות רגרסיית פואסון לניבוי מספר ימי ההיעדרות
| מנבא | B | SE | Wald χ² | p | Exp(B) | רווח בר סמך 95% |
|---|---|---|---|---|---|---|
| קבוע | 0.48 | 0.19 | 6.65 | .010 | 1.62 | [1.12, 2.34] |
| עומס עבודה | 0.30 | 0.07 | 18.76 | <.001 | 1.35 | [1.18, 1.55] |
| תמיכה חברתית | -0.09 | 0.06 | 2.14 | .143 | 0.91 | [0.81, 1.03] |
| מחלקה A מול ייחוס | 0.41 | 0.13 | 9.45 | .002 | 1.51 | [1.16, 1.96] |
הערה מתחת לטבלה: "N = 150. יחס סטייה לדרגות חופש = 1.15."
לניתוח של זמן עד אירוע ולא של מספר אירועים ראו רגרסיית קוקס, ולסיוע בבניית מודלים מסוג זה ראו את עמוד הניתוחים הסטטיסטיים ב-R.
