[Home] AI로 돌아가기

Fitting - 적합

Fitting(적합)은 머신러닝/딥러닝 모델이 주어진 데이터에 얼마나 잘 들어맞는지를 나타내는 개념이다. 모델의 성능은 훈련 데이터뿐만 아니라 새로운 데이터(테스트 데이터)에 대한 일반화 능력을 기준으로 평가되어야 한다.

(1) 최적적합 (Optimal Fitting)

모델이 훈련 데이터에 잘 학습되었을 뿐만 아니라, 새로운 테스트 데이터에도 높은 성능을 유지하는 상태이다. 이는 모델이 과적합도 과소적합도 아닌 일반화에 최적화된 상태이다.

오차 관점에서 보면, 훈련 오차(training error)와 검증 오차(validation error)가 모두 낮고, 두 오차의 차이(gap)가 작아 모델이 데이터에 잘 일반화되고 있음을 의미한다.

(2) 과소적합 (Underfitting)

모델이 훈련 데이터에서도 성능이 낮고, 테스트 데이터에서도 마찬가지로 성능이 좋지 않은 상태이다. 이는 모델이 지나치게 단순하여 데이터의 패턴을 충분히 학습하지 못한 경우에 해당한다.

오차 관점에서 보면, 훈련 오차와 검증(테스트) 오차가 모두 높게 유지되는 상태이다. 이는 모델의 표현력(complexity)이 부족하여 데이터의 패턴 자체를 충분히 학습하지 못했기 때문이다.

해결 방법:

(3) 과대적합/과적합 (Overfitting)

모델이 훈련 데이터에 지나치게 잘 맞아서, 테스트 데이터에서는 성능이 급격히 떨어지는 상태이다. 모델이 노이즈나 예외적인 패턴까지 학습해버려 일반화 능력이 낮아지는 경우이다.

오차 관점에서 보면, 훈련 오차는 낮지만 검증(테스트) 오차는 높게 유지되는 상태이다. 이때 성능을 향상시키기 위해 모델의 복잡도를 더 높이는 것은 오히려 역효과이며, 복잡도를 낮추거나 정규화 등을 적용하는 것이 올바른 해결 방향이다. 또한 과적합은 단순히 데이터 양이 부족해서만 발생하는 것이 아니라, 모델이 지나치게 복잡하거나 학습을 과도하게 진행한 경우에도 발생할 수 있다.

해결 방법:

...
최적적합, 과대적합, 과소적합 예시
...
최적적합, 과대적합, 과소적합 예시
출처: 서지영, 난생처음 인공지능 입문(2판), 한빛아카데미, 2024
과적합은 데이터가 부족해서 발생하므로, 데이터의 양을 늘려 학습하면 해결할 수 있다.

확인 문제

다음 그래프에 대한 설명으로 옳지 않은 것은? (단, x는 특징, y는 레이블이다)

(가), (나), (다) 세 가지 그래프 - Model, True function, Samples 비교
(가) 과소적합 / (나) 최적적합 / (다) 과대적합 예시 그래프
  1. (가)는 모델의 표현력이 부족해 훈련 오차와 검증 오차가 모두 높게 유지되는 상황을 나타낸다.
  2. (나)는 훈련 오차와 검증 오차가 모두 낮고 서로 차이가 작아, 모델이 데이터에 일반화되고 있음을 보여 준다.
  3. (다)는 훈련 오차가 낮고 검증 오차는 높게 유지되므로, 성능을 향상하기 위해서 모델 복잡도를 더 높여야 한다.
  4. 기계 학습에서 과적합은 학습 데이터에서 성능이 뛰어나지만 일반화에 대한 성능을 보장할 수 없다.
정답 · 해설 보기

정답: ③