오늘 끝나면
정규화 회귀 (Ridge·Lasso)
- ✓정규화 회귀 (Ridge·Lasso)의 핵심 문제를 한 문장으로 설명한다
- ✓오른쪽 실습에서 정규화이 어떻게 움직이는지 관찰한다
- ✓다음 강의와 이어지는 한계를 말할 수 있다
실습 미션
계수를 눌러 과적합을 막고 변수를 고름 이 문장이 실제로 무슨 뜻인지 실습에서 한 번 손으로 확인한다.
성공 조건
- □실습의 기본값을 먼저 관찰
- □입력값이나 모드를 한 번 이상 바꿔 결과 비교
- □왜 결과가 바뀌었는지 한 문장으로 설명
통계 · 30
정규화 회귀
(Ridge·Lasso)
계수가 너무 커지면 과적합이다. 그래서 계수 크기에 벌점을 붙인다.
Ridge(L2)는 계수를 작게 줄이고, Lasso(L1)는 일부를 0으로 만든다.
강도는 λ로 조절한다. 편향은 늘고 분산은 준다.
과적합 = 계수가 폭주하는 것
최소제곱은 잔차제곱합만 줄인다. 데이터가 적거나 변수가 많으면 잡음까지 맞추려 든다.
그때 계수가 비정상적으로 커진다. +500, −480처럼 큰 값이 서로 상쇄하며 학습 데이터에 딱 붙는다.
학습 오차는 0에 가깝지만 새 데이터에는 엉뚱한 예측을 낸다.
이게 과적합이다. 모델이 신호가 아니라 표본의 우연까지 외운 상태다.
공선성, 즉 특성끼리 겹치는 상황이면 계수가 더 불안정하게 튄다.
정규화는 계수가 커지는 것을 손해로 친다.
잔차제곱합에 “계수 크기 벌점”을 더해 같이 최소화한다.
검정은 최소제곱으로 잡음에 폭주하고, 파랑은 정규화로 작게 눌린다
목적함수 = 오차 + 계수 벌점
정규화는 최소화 대상에 항 하나를 더 붙이는 일이다. 오차만 보던 걸 계수까지 같이 본다.
Ridge는 계수 제곱합을 벌점으로 쓴다. SSE + λ·Σβⱼ², L2 벌점이다.
Lasso는 계수 절댓값합을 벌점으로 쓴다. SSE + λ·Σ|βⱼ|, L1 벌점이다.
λ는 두 욕심의 저울이다. 데이터에 맞추려는 힘과 계수를 작게 두려는 힘이 여기서 맞선다.
λ=0이면 벌점이 사라져 그냥 최소제곱이 된다.
절편은 보통 벌점에서 뺀다. 평균 위치를 옮기는 항이라 줄일 이유가 없다.
또 벌점이 공정하려면 특성을 표준화해 스케일을 맞춰야 한다.
SSE + λ·Σβⱼ²
계수 제곱합에 벌점
SSE + λ·Σ|βⱼ|
계수 절댓값합에 벌점
L2 vs L1, 작게냐 0이냐
벌점 모양 하나 차이가 결과를 완전히 바꾼다. Ridge와 Lasso가 갈리는 지점이다.
Ridge(L2)는 제약 영역이 원이다. 모서리가 없어 계수를 매끄럽게 작게 당긴다.
공선성에 강건하다. 겹친 변수끼리 계수를 비슷하게 나눠 가진다. 하지만 0에는 거의 안 닿는다.
Lasso(L1)는 제약 영역이 마름모다. 축 위에 뾰족한 꼭짓점이 있다.
해가 그 꼭짓점에 자주 걸려 일부 계수가 정확히 0이 된다. 변수 선택이 자동으로 일어난다.
그래서 Ridge는 다 남기되 작게 줄이고, Lasso는 쓸 변수만 남기고 나머지를 끈다.
둘을 섞은 게 엘라스틱넷(L1+L2)이다. 상황에 따라 골라 쓴다.
표면에 닿음 (β≠0)
꼭짓점=축 (β2=0)
마름모는 축 위에 모서리가 있어 해가 거기 걸리고 계수가 0이 된다
λ를 올리면 계수가 0으로
λ를 올리면 계수가 줄어드는 경로를 눈으로 따라갈 수 있다.
Lasso와 Ridge를 토글하며, 참계수가 0인 노이즈 변수(회색 라벨)가 어떻게 처리되는지 보면 차이가 분명하다.
Lasso는 약한 계수부터 정확히 0으로 떨어뜨려 변수를 골라낸다.
Ridge는 다 함께 매끄럽게 작아지지만 0에는 거의 안 닿는다.
λ를 키울수록 계수가 작아지고 편향은 오르고 분산은 내려간다.
λ를 줄이면 최소제곱에 가까워져 편향은 내려가고 분산은 오른다. 적정 λ는 교차검증으로 고른다.
파랑 라벨 = 참계수≠0 / 회색 라벨 = 참계수 0(노이즈)
3 / 6
3.86
Lasso는 λ가 커질수록 계수를 정확히 0으로 떨궈 변수를 골라낸다. 지금 3개가 탈락했다.
정리, 벌점으로 산 일반화
정규화는 계수 크기에 벌점을 붙여 과적합을 누르는 회귀다. 강도는 λ로 정한다.
Ridge(L2)는 계수를 작게 줄이고 공선성에 강건하다. 변수는 다 남긴다.
Lasso(L1)는 일부 계수를 0으로 떨궈 변수 선택까지 한다.
공통 대가는 편향이 오르고 분산이 내려가는 것이다. 학습 적합은 약간 포기하고 일반화를 산다.
λ는 교차검증으로 검증오차가 가장 작은 값을 고른다.
Q. Lasso가 Ridge와 다른 점은?
정답은 일부 계수를 정확히 0으로 만들어 변수 선택까지 한다는 점이다.Ridge는 L2 벌점이라 계수를 매끄럽게 작게 줄일 뿐 0에는 거의 안 닿고 변수를 다 남긴다.
Lasso는 L1 벌점이라 제약 영역의 뾰족한 꼭짓점에 해가 걸려 약한 계수를 0으로 떨군다.
그래서 Lasso는 회귀와 변수 선택을 동시에 한다.
| Ridge | Lasso | |
|---|---|---|
| 벌점 | Σβⱼ² (L2) | Σ|βⱼ| (L1) |
| 계수 | 작게 | 일부 0 |
| 변수 선택 | 안 함 | 함 |
| 공선성 | 강건 | 하나만 택 |