📈 គណនា Regression

បញ្ចូលសំណុំទិន្នន័យ · ជ្រើសរាងអនុគមន៍ · តម្រែតម្រង់ · ពិនិត្យ · ទស្សន៍ទាយ

ការបង្ហាញ និងការវិនិច្ឆ័យ (Visualization & Diagnostics)

Model ដែល fit រួច មិនមាន model ដែល fit រួចទេ។
🔬 ពន្យល់ការវិនិច្ឆ័យ (Diagnostics)

សំណល់ vs Fitted (Residuals vs Fitted)

សំណល់ᵢ = yᵢ − ŷᵢ
ត្រូវការ៖ ខ្ចាត់ខ្ចាយចៃដន្យជុំវិញ 0 ដោយគ្មានលំនាំ។
បើឃើញ៖
• រាង U → ត្រូវការ polynomial ដឺក្រេខ្ពស់ជាង
• រាងកោង (funnel) → បំរែបំរួលមិនស្មើ (heteroscedasticity)
• ចំណុចឆ្ងាយ → តម្លៃក្រៅបណ្តាញ (outliers)

Q-Q Plot (ធម្មតា — normality)

សំណល់រៀបតាមលំដាប់ vs ចំណុចក្បៀសទ្រឹស្តី
ត្រូវការ៖ ចំណុចនៅលើបន្ទាត់ត្រង់។
បើឃើញ៖
• កោង S → បំណែងចែកធាត់ខ្លាំង (heavy tails)
• កោងរាង U → ផ្អៀង (skewed)
សំខាន់សម្រាប់៖ p-values ត្រឹមត្រូវទាមទារ normality

ចម្ងាយ Cook (Cook's Distance)

Dᵢ = (residualᵢ² / (p · MSE)) · (hᵢᵢ / (1 − hᵢᵢ)²) ដែល hᵢᵢ = leverage នៃចំណុច i = Xᵢ (XᵀX)⁻¹ Xᵢᵀ
ត្រូវការ៖ Dᵢ < 1 សម្រាប់ចំណុចទាំងអស់។
Dᵢ > 4/n: គួរសង្កេត
Dᵢ > 1: ចំណុចមានឥទ្ធិពល — សាកលុប ហើយមើលថា model ប្រែឬអត់

VIF (កត្តាបំប៉ោងបំរែបំរួល)

VIFⱼ = 1 / (1 − R²ⱼ) ដែល R²ⱼ = R² ពី regressing xⱼ លើ feature ផ្សេងទៀត
ត្រូវការ៖ VIF < 5 សម្រាប់ feature ទាំងអស់។
• VIF > 5 → multicollinearity មធ្យម
• VIF > 10 → ធ្ងន់ធ្ងរ — គួរលុប feature ឬប្រើ Ridge
សញ្ញា៖ SE ធំបើ VIF ខ្ពស់
📋 VIF (កត្តាបំប៉ោងបំរែបំរួល — Variance Inflation Factor)

តម្រូវម៉ូដែល ដើម្បីគណនា VIF។

📖 សទ្ទានុក្រម (Glossary) — ពន្យល់គ្រប់ពាក្យ

អថេរ និងលទ្ធផល

y
អថេរអាស្រ័យ (dependent variable) — តម្លៃដែលយើងចង់ទស្សន៍ទាយ
x
អថេរឯករាជ្យ (independent variable) — input ដែលយើងប្រើសម្រាប់ទស្សន៍ទាយ
ŷ
តម្លៃទស្សន៍ទាយ (predicted value) — f(x)
β
មេគុណ (coefficient) — ទម្ងន់នៃលក្ខណៈនីមួយៗ
β̂
មេគុណដែលបានប៉ាន់ស្មាន (estimated coefficient)
ε
សំណល់ (residual) — y − ŷ
n
ចំនួនចំណុច (number of observations)
p
ចំនួនមេគុណ (number of coefficients)
df
ដឺក្រេសេរី (degrees of freedom) = n − p

Metrics

R²
មេគុណកំណត់ (coefficient of determination) — ភាគរយនៃបំរែបំរួល y ដែល model ពន្យល់បាន។ ជិត 1 = ល្អ។
R² កែសម្រួល
Adjusted R² — R² ដែលដាក់ទណ្ឌកម្មចំនួនលក្ខណៈ។ ប្រសើរជាង R² ពេលប្រៀបធៀប model ខុសគ្នា។
RMSE
ឫសការេនៃកំហុសការេមធ្យម — កំហុសមធ្យមជាឯកតាដូច y។ តូច = ល្អ។
MAE
កំហុសដាច់ខាតមធ្យម — ចម្ងាយមធ្យមរវាងទស្សន៍ទាយ និងពិត។ ធន់នឹង outlier ជាង RMSE។
CV R²
R² ឆ្លងកាត់ (cross-validated) — មធ្យម ± គម្លាតស្តង់ដារ នៃ R² លើ k ផ្នែក។

លក្ខខណ្ឌស្ថិតិ (Statistical terms)

SE
កំហុសស្តង់ដារ (Standard Error) — ភាពមិនច្បាស់នៃមេគុណ
t
តម្លៃ t (t-statistic) — β̂ / SE
p-value
ប្រូបាប៊ីលីតេដែលមេគុណពិតជាស្មើ 0
CI 95%
ចន្លោះជឿជាក់ 95% (Confidence Interval)
PI 95%
ចន្លោះទស្សន៍ទាយ 95% (Prediction Interval)
VIF
កត្តាបំប៉ោងបំរែបំរួល (Variance Inflation Factor) — វាស់ multicollinearity
Cook's D
ចម្ងាយ Cook — វាស់ឥទ្ធិពលនៃចំណុចនីមួយៗលើ model
Leverage
hᵢᵢ — វាស់ថាចំណុចនីមួយៗ "ទាញ" បន្ទាត់ fit ប៉ុណ្ណា

Hyperparameters

λ (lambda)
កម្រិត regularization — ទណ្ឌកម្មលើមេគុណធំ
α (alpha)
លាយ elastic — 0 = Ridge, 1 = Lasso, រវាង = លាយ
degree
ដឺក្រេនៃ polynomial
k-folds
ចំនួនផ្នែកក្នុង cross-validation
test size
សមាមាត្រនៃទិន្នន័យសម្រាប់ test
iterations
ចំនួនជុំអតិបរមាសម្រាប់ iterative solver