모델을 복잡하게 만들수록 훈련 데이터는 더 잘 맞힌다. 그런데 정작 새 데이터에서는 오히려 성능이 떨어지곤 한다. 이번 글은 그 함정인 과적합과, 이를 누르는 정규화를 정리한다. 1. 과소적합과 과적합 : 과소적합(underfitting) - 모델이 너무 단순해 데이터의 규칙조차 제대로 못 잡음. 훈련도 테스트도 둘 다 성능이 낮음 : 적정(good fit) - 큰 규칙을 잡으면서 잡음은 무시함. 새 데이터에서도 잘 맞음 : 과적합(overfitting) - 모델이 너무 복잡해 훈련 데이터의 잡음까지 외움. 훈련은 거의 완벽한데 새 데이터에선 크게 틀림 2. 과적합은 왜 생기나 : 변수나 모델 복잡도가 데이터 양에 비해 너무 크면 생김 : 모델이 "규칙"이 아니라 "이 훈련 데이터만의 우연"까지..