ការបង្ហាញ និងការវិនិច្ឆ័យ (Visualization & Diagnostics)
Model ដែល fit រួច
មិនមាន model ដែល fit រួចទេ។
🔬 ពន្យល់ការវិនិច្ឆ័យ (Diagnostics)
សំណល់ vs Fitted (Residuals vs Fitted)
សំណល់ᵢ = yᵢ − ŷᵢ
ត្រូវការ៖ ខ្ចាត់ខ្ចាយចៃដន្យជុំវិញ 0 ដោយគ្មានលំនាំ។
បើឃើញ៖
• រាង U → ត្រូវការ polynomial ដឺក្រេខ្ពស់ជាង
• រាងកោង (funnel) → បំរែបំរួលមិនស្មើ (heteroscedasticity)
• ចំណុចឆ្ងាយ → តម្លៃក្រៅបណ្តាញ (outliers)
បើឃើញ៖
• រាង U → ត្រូវការ polynomial ដឺក្រេខ្ពស់ជាង
• រាងកោង (funnel) → បំរែបំរួលមិនស្មើ (heteroscedasticity)
• ចំណុចឆ្ងាយ → តម្លៃក្រៅបណ្តាញ (outliers)
Q-Q Plot (ធម្មតា — normality)
សំណល់រៀបតាមលំដាប់ vs ចំណុចក្បៀសទ្រឹស្តី
ត្រូវការ៖ ចំណុចនៅលើបន្ទាត់ត្រង់។
បើឃើញ៖
• កោង S → បំណែងចែកធាត់ខ្លាំង (heavy tails)
• កោងរាង U → ផ្អៀង (skewed)
សំខាន់សម្រាប់៖ p-values ត្រឹមត្រូវទាមទារ normality
បើឃើញ៖
• កោង S → បំណែងចែកធាត់ខ្លាំង (heavy tails)
• កោងរាង U → ផ្អៀង (skewed)
សំខាន់សម្រាប់៖ p-values ត្រឹមត្រូវទាមទារ normality
ចម្ងាយ Cook (Cook's Distance)
Dᵢ = (residualᵢ² / (p · MSE)) · (hᵢᵢ / (1 − hᵢᵢ)²)
ដែល hᵢᵢ = leverage នៃចំណុច i = Xᵢ (XᵀX)⁻¹ Xᵢᵀ
ត្រូវការ៖ Dᵢ < 1 សម្រាប់ចំណុចទាំងអស់។
Dᵢ > 4/n: គួរសង្កេត
Dᵢ > 1: ចំណុចមានឥទ្ធិពល — សាកលុប ហើយមើលថា model ប្រែឬអត់
Dᵢ > 4/n: គួរសង្កេត
Dᵢ > 1: ចំណុចមានឥទ្ធិពល — សាកលុប ហើយមើលថា model ប្រែឬអត់
VIF (កត្តាបំប៉ោងបំរែបំរួល)
VIFⱼ = 1 / (1 − R²ⱼ)
ដែល R²ⱼ = R² ពី regressing xⱼ លើ feature ផ្សេងទៀត
ត្រូវការ៖ VIF < 5 សម្រាប់ feature ទាំងអស់។
• VIF > 5 → multicollinearity មធ្យម
• VIF > 10 → ធ្ងន់ធ្ងរ — គួរលុប feature ឬប្រើ Ridge
សញ្ញា៖ SE ធំបើ VIF ខ្ពស់
• VIF > 5 → multicollinearity មធ្យម
• VIF > 10 → ធ្ងន់ធ្ងរ — គួរលុប feature ឬប្រើ Ridge
សញ្ញា៖ SE ធំបើ VIF ខ្ពស់
📋 VIF (កត្តាបំប៉ោងបំរែបំរួល — Variance Inflation Factor)
តម្រូវម៉ូដែល ដើម្បីគណនា VIF។
📖 សទ្ទានុក្រម (Glossary) — ពន្យល់គ្រប់ពាក្យ
អថេរ និងលទ្ធផល
- y
- អថេរអាស្រ័យ (dependent variable) — តម្លៃដែលយើងចង់ទស្សន៍ទាយ
- x
- អថេរឯករាជ្យ (independent variable) — input ដែលយើងប្រើសម្រាប់ទស្សន៍ទាយ
- ŷ
- តម្លៃទស្សន៍ទាយ (predicted value) — f(x)
- β
- មេគុណ (coefficient) — ទម្ងន់នៃលក្ខណៈនីមួយៗ
- β̂
- មេគុណដែលបានប៉ាន់ស្មាន (estimated coefficient)
- ε
- សំណល់ (residual) — y − ŷ
- n
- ចំនួនចំណុច (number of observations)
- p
- ចំនួនមេគុណ (number of coefficients)
- df
- ដឺក្រេសេរី (degrees of freedom) = n − p
Metrics
- R²
- មេគុណកំណត់ (coefficient of determination) — ភាគរយនៃបំរែបំរួល y ដែល model ពន្យល់បាន។ ជិត 1 = ល្អ។
- R² កែសម្រួល
- Adjusted R² — R² ដែលដាក់ទណ្ឌកម្មចំនួនលក្ខណៈ។ ប្រសើរជាង R² ពេលប្រៀបធៀប model ខុសគ្នា។
- RMSE
- ឫសការេនៃកំហុសការេមធ្យម — កំហុសមធ្យមជាឯកតាដូច y។ តូច = ល្អ។
- MAE
- កំហុសដាច់ខាតមធ្យម — ចម្ងាយមធ្យមរវាងទស្សន៍ទាយ និងពិត។ ធន់នឹង outlier ជាង RMSE។
- CV R²
- R² ឆ្លងកាត់ (cross-validated) — មធ្យម ± គម្លាតស្តង់ដារ នៃ R² លើ k ផ្នែក។
លក្ខខណ្ឌស្ថិតិ (Statistical terms)
- SE
- កំហុសស្តង់ដារ (Standard Error) — ភាពមិនច្បាស់នៃមេគុណ
- t
- តម្លៃ t (t-statistic) — β̂ / SE
- p-value
- ប្រូបាប៊ីលីតេដែលមេគុណពិតជាស្មើ 0
- CI 95%
- ចន្លោះជឿជាក់ 95% (Confidence Interval)
- PI 95%
- ចន្លោះទស្សន៍ទាយ 95% (Prediction Interval)
- VIF
- កត្តាបំប៉ោងបំរែបំរួល (Variance Inflation Factor) — វាស់ multicollinearity
- Cook's D
- ចម្ងាយ Cook — វាស់ឥទ្ធិពលនៃចំណុចនីមួយៗលើ model
- Leverage
- hᵢᵢ — វាស់ថាចំណុចនីមួយៗ "ទាញ" បន្ទាត់ fit ប៉ុណ្ណា
Hyperparameters
- λ (lambda)
- កម្រិត regularization — ទណ្ឌកម្មលើមេគុណធំ
- α (alpha)
- លាយ elastic — 0 = Ridge, 1 = Lasso, រវាង = លាយ
- degree
- ដឺក្រេនៃ polynomial
- k-folds
- ចំនួនផ្នែកក្នុង cross-validation
- test size
- សមាមាត្រនៃទិន្នន័យសម្រាប់ test
- iterations
- ចំនួនជុំអតិបរមាសម្រាប់ iterative solver