Study List for Linear Models Exam 2

This list may not be exhaustive but should be a good start, I encourage you to go through our slides, exercises, and notes from the class to best prepare for the upcoming midterm.

OLS

  • \(\hat{\boldsymbol{\beta}} = (\mathbf{X}^T\mathbf{X})^{-1}\mathbf{X}^T\mathbf{y}\)
  • \(\hat{\mathbf{y}} = \mathbf{H}\mathbf{y}, \quad \mathbf{H} = \mathbf{X}(\mathbf{X}^T\mathbf{X})^{-1}\mathbf{X}^T\)
  • \(\hat{\boldsymbol{\beta}} \sim N(\boldsymbol{\beta},\; \sigma^2(\mathbf{X}^T\mathbf{X})^{-1})\)
  • \(\hat{\sigma}^2 = \text{SSE}/(n-p)\)
  • \(\text{se}(\hat{\beta}_j) = \hat{\sigma}\sqrt{[(\mathbf{X}^T\mathbf{X})^{-1}]_{jj}}\)

Inference

  • \(t = \hat{\beta}_j / \text{se}(\hat{\beta}_j) \sim t_{n-p}\)
  • \(\hat{\beta}_j \pm t_{\alpha/2,\,n-p} \cdot \text{se}(\hat{\beta}_j)\)
  • Confidence interval for \(E[y_\text{new}]\): \(\hat{y}_\text{new} \pm t_{\alpha/2,\,n-p}\cdot\hat{\sigma}\sqrt{\mathbf{x}_\text{new}^T(\mathbf{X}^T\mathbf{X})^{-1}\mathbf{x}_\text{new}}\)
  • Prediction interval for \(y_\text{new}\): \(\hat{y}_\text{new} \pm t_{\alpha/2,\,n-p}\cdot\hat{\sigma}\sqrt{1 + \mathbf{x}_\text{new}^T(\mathbf{X}^T\mathbf{X})^{-1}\mathbf{x}_\text{new}}\)

Model Fit

  • \(R^2 = 1 - \text{SSE}/\text{SST}\)
  • \(R^2_\text{adj} = 1 - \dfrac{\text{SSE}/(n-p)}{\text{SST}/(n-1)}\)
  • \(\text{AIC} = n\log(\text{MSE}) + 2p + C\)
  • \(C_p = \text{SSE}/\hat{\sigma}^2 - n + 2p\)
  • \(\text{LOOCV} = \dfrac{1}{n}\displaystyle\sum_{i=1}^n \left(\dfrac{y_i - \hat{y}_i}{1 - h_i}\right)^2\)

Leverage & Diagnostics

  • \(h_i = H_{ii}, \quad \sum h_i = p, \quad\) flag if \(h_i > 2p/n\)
  • \(\text{Var}(\hat{\varepsilon}_i) = \sigma^2(1-h_i)\)
  • Standardized: \(r_i = \hat{\varepsilon}_i \;/\; \hat{\sigma}\sqrt{1-h_i}\)
  • Studentized: \(t_i = \hat{\varepsilon}_i \;/\; \hat{\sigma}_{(i)}\sqrt{1-h_i} \sim t_{n-p-1}\)
  • Cook’s \(D\): \(D_i = \dfrac{r_i^2}{p}\cdot\dfrac{h_i}{1-h_i}\)

Ridge Regression

  • \(\min_{\boldsymbol{\beta}}\;(\mathbf{y}-\mathbf{X}\boldsymbol{\beta})^T(\mathbf{y}-\mathbf{X}\boldsymbol{\beta}) + \lambda\boldsymbol{\beta}^T\boldsymbol{\beta}\)
  • \(\hat{\boldsymbol{\beta}}_\text{ridge} = (\mathbf{X}^T\mathbf{X}+\lambda\mathbf{I})^{-1}\mathbf{X}^T\mathbf{y}\)
  • \(E[\hat{\boldsymbol{\beta}}_\text{ridge}] = (\mathbf{X}^T\mathbf{X}+\lambda\mathbf{I})^{-1}\mathbf{X}^T\mathbf{X}\boldsymbol{\beta}\)
  • \(\text{Var}(\hat{\boldsymbol{\beta}}_\text{ridge}) = \sigma^2(\mathbf{X}^T\mathbf{X}+\lambda\mathbf{I})^{-1}\mathbf{X}^T\mathbf{X}(\mathbf{X}^T\mathbf{X}+\lambda\mathbf{I})^{-1}\)
  • \(\text{df}(\lambda) = \text{tr}(\mathbf{H}_\lambda), \quad \mathbf{H}_\lambda = \mathbf{X}(\mathbf{X}^T\mathbf{X}+\lambda\mathbf{I})^{-1}\mathbf{X}^T\)

Splines

  • \(\hat{y} = \hat\beta_0 + \hat\beta_1 x + \hat\beta_2 x^2 + \hat\beta_3 x^3 + \displaystyle\sum_{k=1}^{K}\hat\beta_{3+k}(x-\xi_k)_+^3\)
  • \((x-\xi_k)_+^3 = (x-\xi_k)^3\) if \(x > \xi_k\), else \(0\)