스킬캠퍼스

오늘 끝나면

회귀 평가지표

  • 회귀 평가지표의 핵심 문제를 한 문장으로 설명한다
  • 오른쪽 실습에서 회귀이 어떻게 움직이는지 관찰한다
  • 다음 강의와 이어지는 한계를 말할 수 있다

실습 미션

MSE·RMSE·MAE — 예측이 얼마나 빗나갔나 재기 이 문장이 실제로 무슨 뜻인지 실습에서 한 번 손으로 확인한다.

성공 조건

  • 실습의 기본값을 먼저 관찰
  • 입력값이나 모드를 한 번 이상 바꿔 결과 비교
  • 왜 결과가 바뀌었는지 한 문장으로 설명

통계 · 23

회귀
평가지표

예측이 얼마나 빗나갔는지를 숫자 하나로 잰다.
잔차를 모으는 방식에 따라 MSE · RMSE · MAE가 갈린다.
값이 낮을수록 좋고, 모델을 비교하는 기준이 된다.

P.01통계 · 23

잔차 = 예측 − 실제

회귀선이 모든 점을 지날 수는 없다. 점마다 빗나감이 남는다.

한 점의 예측값 ŷ에서 실제값 y를 뺀 것이 잔차다.
잔차 = ŷ − y, 즉 점과 직선 사이의 세로 거리다.

위로 빗나가면 +, 아래로 빗나가면 −가 된다.
그냥 다 더하면 +와 −가 상쇄돼 0에 가까워지고, 빗나간 양을 잴 수 없다.

그래서 부호를 없앤 다음 모은다.
제곱으로 없애면 MSE 계열이고, 절댓값으로 없애면 MAE다.
어느 쪽이든 잔차들을 한 숫자로 압축해 “얼마나 틀렸나”를 잰다.

한 점의 빗나간 길이
잔차 = ŷ − y
xy

선분 하나가 잔차다. 이걸 제곱이나 절댓값으로 모은다

P.02통계 · 23

MSE · RMSE, 제곱이라 큰 오차에 민감

첫 방식은 잔차를 제곱해 평균을 낸다. 그것이 평균제곱오차 MSE다.

MSE = (1/n)·Σ(ŷᵢ − yᵢ)²
제곱이라 부호가 사라지고, 큰 잔차일수록 벌점이 제곱으로 커진다.
잔차 2는 벌점 4, 잔차 4는 벌점 16이라 멀리 튄 점이 값을 확 끌어올린다.

단점은 단위가 제곱이라 직관에 안 맞는다는 것이다. y가 만원이면 MSE는 만원²이다.
그래서 제곱근을 씌운 것이 RMSE = √MSE다.
RMSE는 y와 같은 단위라 “평균 ±얼마 틀림”으로 바로 읽힌다.

RMSE도 제곱을 거쳐 나온 값이라 큰 오차에 여전히 민감하다.
항상 RMSE ≥ MAE가 성립하고, 둘이 벌어질수록 오차가 들쭉날쭉이라는 신호다.

잔차를 제곱해 평균
제곱 벌점, 잔차²
잔차 1 → 벌점1
잔차 2 → 벌점4
잔차 3 → 벌점9
잔차 4 → 벌점16

잔차가 2배면 벌점은 4배다. 큰 오차가 제곱으로 부풀어 값을 끌어올린다

RMSE = √MSE · y와 같은 단위
P.03통계 · 23

MAE, 절댓값이라 이상치에 강건

둘째 방식은 잔차의 절댓값을 평균 낸다. 그것이 평균절대오차 MAE다.

MAE = (1/n)·Σ|ŷᵢ − yᵢ|
벌점이 거리에 비례할 뿐 제곱처럼 폭증하지 않는다.
잔차 2는 벌점 2, 잔차 4는 벌점 4라서 멀리 튄 점도 제 몫만큼만 반영된다.

그래서 이상치, 즉 튀는 한 점에 강건하다. 데이터에 오류나 극단값이 섞여도 덜 흔들린다.
단위도 y 그대로라 해석이 쉽다.

정리하면 선택 기준이 갈린다.
큰 오차를 특히 잡고 싶으면 MSE와 RMSE를 쓴다.
이상치에 휘둘리기 싫으면 MAE를 쓴다.
둘을 같이 보면 오차 분포의 모양까지 읽힌다.

잔차의 절댓값을 평균
제곱 vs 절댓값 벌점
잔차제곱 (MSE)|·| (MAE)
111
242
393
4164

절댓값은 거리에 비례한다. 멀리 튄 점도 제 몫만큼만 반영돼 강건하다

P.04통계 · 23

직접 흐트러뜨려 보기

오른쪽에서 예측을 직접 흐트러뜨려 본다.

슬라이더로 예측을 회귀선에서 띄우면 잔차가 커진다.
MSE와 RMSE, MAE가 동시에 오른다. 낮을수록 좋은 값이다.

이제 이상치 한 점 버튼을 눌러 보자.
가운데 한 점만 예측이 멀리 튄다.
MSE와 RMSE 막대는 확 뛰는데 MAE는 조금만 움직인다.

이것이 핵심 차이다.
제곱을 쓰는 MSE와 RMSE는 그 한 점의 큰 오차를 크게 반영한다.
절댓값을 쓰는 MAE는 거리만큼만 반영해 덜 흔들린다. 이것이 강건함의 정체다.

노이즈·이상치로 세 지표 실시간
오차지표 비교 · 직접 흐트러뜨리기

검정 = 실제 · 파랑 = 예측 · 선분 = 잔차(예측−실제)

예측 흐트러뜨리기1.20
세 지표, 낮을수록 좋다
MSE0.26
잔차² 평균
RMSE0.51
√MSE · 원단위
MAE0.35
|잔차| 평균

노이즈를 키우면 셋 다 오른다. RMSE는 MSE보다 점잖게 오른다(√라서).

P.05통계 · 23

정리, 잔차를 어떻게 모으나

회귀 평가지표는 잔차, 즉 예측에서 실제를 뺀 값을 한 숫자로 모은 것이다.

MSE는 제곱 평균이고, RMSE는 그 제곱근으로 원래 단위를 되살린 값이며, MAE는 절댓값 평균이다.
셋 다 낮을수록 좋고, 같은 데이터와 같은 지표로 재야 모델 비교가 공정하다.

제곱 계열은 큰 오차에 민감하고, 절댓값 계열은 이상치에 강건하다.
다음 강은 결정계수 R²다. 오차의 크기가 아니라 “설명한 비율”로 모델을 평가하는 지표로 넘어간다.

Q. RMSE가 MAE보다 이상치에 민감한 이유는?오차를 제곱하기 때문이다.
MSE와 RMSE는 잔차를 제곱해 모으므로 큰 오차가 제곱으로 부풀어 값에 크게 반영된다.
MAE는 잔차의 절댓값만 더해 거리에 비례할 뿐이라, 멀리 튄 한 점도 제 몫만큼만 들어가 덜 흔들린다.
세 지표 한눈 대조표
세 지표, 낮을수록 좋다
지표정의성질
MSEΣ잔차² / n단위²제곱·큰 오차 민감
RMSE√MSEy 단위큰 오차 민감
MAEΣ|잔차| / ny 단위이상치 강건

3줄 요약

  1. 1MSE·RMSE·MAE — 예측이 얼마나 빗나갔나 재기
  2. 2회귀 평가지표은 분포 → 표본 → 검정 → 회귀 → 모델 선택 흐름 안의 한 칸이다.
  3. 3개념을 외우는 것보다 입력을 바꾸면 무엇이 달라지는지 보는 것이 우선이다.

완료 전 점검

복습 카드

회귀

MSE·RMSE·MAE — 예측이 얼마나 빗나갔나 재기

분포

데이터가 어떤 모양으로 퍼져 있는지 나타낸 것

표본

전체를 알기 위해 뽑아 본 일부 데이터