INSIGHT
Tech Blog
LabQ의 엔지니어들이 현장의 문제를 해결하며 얻은 기술적 경험과 R&D 인사이트를 공유합니다.
[ENGINEERING] 표준 지표의 함정
-
반
반세현
전임연구원
- 26.07.15
TL;DR
산업 품질 예측 과제에서 두 후보 모델 중 하나를 골라야 했다. 교과서적 지표(MAE, R²)는 Model B를 명백한 승자로 지목했지만, 이 공정에서 운영·안전 리스크는 신호가 안정적인 대다수 구간이 아니라 드물게 규격을 벗어나는 이탈(off-spec) 구간에 몰려 있었다 — 쓸모 있는 모델은 평균 오차가 작은 모델이 아니라 그 순간을 미리 보는 모델이다. 이 관점에서 만든 도메인 맞춤 지표는 정반대로 Model A를 골랐고, 표준 지표가 왜 여기서 오도했는지도 설명해 주었다. 이 글의 진짜 산출물은 모델이 아니라 '좋음'의 정의였다. 응용 ML에서 가장 레버리지가 큰 작업은 모델링이 아니라, "무엇을 좋은 모델이라 부를 것인가"를 문제에 맞게 다시 정의하는 일일 때가 있다.
공개 범위
이 글은 연속식 화학 제조 공정에서 품질 지표를 예측하는 실제 딜리버리 과제의 모델 선택 국면에서 출발했다. 다만 고객·사업장 식별 정보, 사내 과제 식별자와 공정 코드명, 예측 대상의 실제 명칭과 실제 목표 수치, 공정 흐름·설비 계통 구조, 관측 기간과 데이터 규모는 의도적으로 가렸다. 이들은 기능 서술로 치환했다 — 예측 대상은 실제 명칭 대신 "품질 지표"로만 부른다. 본문의 그림은 전부 개념 설명용으로 재구성한 도해이며 실제 공정 흐름이나 대시보드가 아니다. 다만 모델 비교 수치(MAE, R², Trend Correlation 등)는 개념용으로 지어낸 값이 아니라 익명화된 실제 비교 결과다 — 공정 물성이 아닌 두 모델의 품질을 재는 무차원 점수(또는 익명 타깃 단위)이며, 이 값만으로는 공정·제품·고객을 역추적할 수 없다. 이 글이 다루지 않는 것: 실제 공정의 물성·안전 정보, 실제 배포 아키텍처, 지표 산출 코드. 이 글은 평가지표를 설계해 모델을 고르는 방법에 관한 글이다.
1. 문제: 두 모델, 갈리는 판정
품질 지표를 예측하는 두 후보가 있었다. 판단을 어렵게 만든 것은 이 신호의 성격이었다.
신호는 대부분의 시간 동안 안정적이다. 값은 좁은 범위에서 잔잔하게 움직인다. 운영과 안전의 위험을 실제로 지는 것은 이 잔잔한 다수 구간이 아니라, 드물게 값이 크게 뛰거나 꺼지며 공정이 규격을 벗어나는 이탈(off-spec) 구간이다. 제어공학에서 계가 목표점 주위로 크게 진동하는 현상을 흔히 "hunting"이라 부르는데, 이 과제의 위험은 정확히 그런 드문 불안정 구간에 있었다.
그렇다면 쓸모 있는 모델의 정의는 분명하다. 평균적으로 오차가 작은 모델이 아니라, 이탈이 다가오는 신호를 미리 잡아내는 모델이다. 이 구분이 결국 모든 것을 갈랐다.
2. 함정: 표준 지표는 Model B를 고른다
범용 회귀 지표로 두 모델을 채점하면 결론은 한쪽으로 분명하게 기운다.
| 지표 | Model A | Model B |
|---|---|---|
| MAE (↓ 좋음) | 0.284 | 0.0898 |
| R² (↑ 좋음) | −13.42 | −0.008 |
MAE로 보면 B가 A보다 세 배가량 정확하고, R²로 보면 A는 처참하다. 어떤 범용 지표를 들이대도 B가 압도적으로 이긴다. 여기서 분석을 멈추면 B를 출시한다.
문제는 그림 1과 이 표가 정반대를 말한다는 데 있다. 눈으로 보면 A가 명백히 신호를 따라가는데, 숫자는 B를 가리킨다. 직관과 지표가 충돌할 때, 둘 중 하나는 잘못된 것을 재고 있다. 다음 절에서 이 지표들이 왜 이 설정에서 거짓말을 하는지 규명한다.
3. 왜 이 지표들이 여기서 거짓말하나
세 가지가 겹쳐서 표준 지표를 오도한다.
(1) 안정 구간이 평균을 지배한다. MAE·MSE·RMSE·MAPE는 모두 신호 전체에 걸친 오차의 평균이다. 신호가 대부분의 시간 동안 잔잔하므로, 이 평균은 대부분 성능이 중요하지 않은 구간의 성능을 측정한다. 정작 중요한 드문 이탈 구간은 평균 속에 희석된다. 이는 희귀 사건이 섞인 회귀 문제의 구조적 함정으로, 불균형 회귀(imbalanced regression) 연구가 "관심 대상이 드물수록 표준 오차 평균은 그것을 무시하도록 최적화된다"는 문제로 정식화해 온 것과 같다.1
(2) 평평한 예측기가 통계적으로 유리하다. 제곱오차 손실 아래에서 상수로 예측할 때 최적값은 평균이고, 일반적으로 기대 제곱오차를 최소화하는 예측은 조건부 기댓값 E[Y|X]다.2 즉 신호가 대부분 평균 근처에 머무는 상황에서는, 거의 움직이지 않고 평균 언저리에 붙어 있는 예측기가 낮은 오차를 얻는다. 그런데 움직이지 않는 모델은 정의상 이탈을 미리 볼 수 없다.
여기서 R²가 결정적 단서를 준다. R²는 오차를 평균으로 예측하는 기준선과 비교하는 지표다. R² = 1 − SS_res/SS_tot에서 분모 SS_tot이 바로 평균 예측기의 오차이므로, R² ≈ 0은 "평균을 예측하는 것과 다를 바 없다"는 뜻이다.3 Model B의 R²(−0.008) ≈ 0은 B가 사실상 평평한 상수/평균 예측기라는 자백이다. 반대로 Model A의 R²(−13.42)가 크게 음수인 것은, A가 분산을 따라가려다 타이밍이나 진폭이 조금만 어긋나도 제곱오차가 그 시도를 가혹하게 벌하기 때문이다. 지표가 우리에게 필요한 바로 그 거동(움직임)을 처벌하고 있는 것이다.
(3) 점 대 점 매칭이 시계열 특성을 못 담는다. MAE류는 같은 시점끼리 1:1로 짝지어 오차를 잰다. 물리 공정에는 이송·측정 지연이 있어, 형태가 옳아도 시점이 몇 스텝 밀린 예측은 점 대 점 매칭에서 이중으로 벌점을 받는다(밀린 자리에서 한 번, 원래 자리에서 또 한 번). 신호가 스탬프가 아니라 시퀀스의 성격을 가지는데, 1:1 매칭은 그 시계열성을 반영하지 못한다.
마지막으로 원론적인 경고 하나. 요약 통계량이 같아도 데이터의 거동은 전혀 다를 수 있다는 것은 Anscombe가 1973년에 네 개의 데이터셋으로 이미 보인 고전적 사실이다.4 하나의 집계 숫자만 보고 모델을 고르는 것은, 그림을 보지 않고 평균만 보는 것과 같다. 우리에게 필요한 것은 집계 오차가 아니라, 모델이 어떤 거동을 재현하는지를 여러 각도에서 재는 지표였다.
4. '좋음'을 다시 정의하기
질문을 바꿨다. "평균 오차가 얼마나 작은가?"가 아니라 "현업이 실제로 의존하는 거동을 모델이 잡아내는가?"로. 그리고 그 질문을 수식으로 옮겼다. 아래 지표들은 현업의 도메인 직관을 계산 가능한 정의로 번역한 것이다.
| 맞춤 지표 | 무엇을 재는가 | 학술적 근거 |
|---|---|---|
| Trend Correlation | 예측이 실제 신호의 형태·방향과 함께 움직이는가(수준이 아니라 공변동) | 예측-실제 계열의 상관. 평평한 예측은 분산이 0이라 상관이 정의되지 않아 0으로 처리 |
| Mean Directional Accuracy (MDA) | 변화의 방향(증가/감소)을 얼마나 자주 맞히는가 | 방향성 예측 평가의 표준. 전환점 포착에 유리하되 변화의 크기는 무시5 |
| Lag-aware MAE | 공정의 물리적 시간 지연을 허용한 뒤의 오차 | 시점을 탄력적으로 정렬하는 elastic matching(DTW) 계열의 발상6 |
| Activity / Moving-average R² | 신호의 변동성을 재현하는가(평균만이 아니라 움직임의 크기) | 평활한 추세 성분의 설명력을 재고 노이즈를 걸러냄 |
| Adjusted MAE / R² (Adj) | 이탈 구간으로 재가중한 오차 | 불균형·효용 기반 회귀에서 관심 구간에 relevance 가중을 주는 발상1 |
이 지표들의 공통점은 도메인 지식을 '좋음'의 정의 안에 직접 넣었다는 것이다. 세 가지 감각을 수식화했다고 요약할 수 있다.
- 역동성(Dynamics) — 단순히 평균을 따라가는 것이 아니라 미세한 변동을 반영하는가. → Activity / Moving-average R²
- 추세 상관(Correlation) — 시점의 오차가 아니라 방향의 옳고 그름을 반영하는가. → Trend Correlation / Lag-aware MAE
- 예외 민감성 — 드문 이탈에 민감하게 반응하는가. → MDA / Adjusted 지표
방향성 지표(MDA)와 탄력적 정렬(Lag-aware)은 임의로 발명한 것이 아니라, 예측의 방향 정확도를 별도로 평가하는 전통5과 시계열을 시점 지연에 관대하게 비교하는 동적 시간 왜곡(DTW) 계열6에 각각 뿌리를 둔다. 우리가 한 일은 이 방법들을 이 공정의 '이탈을 미리 본다'는 목적에 맞게 조합·가중한 것이다.
5. 반전: 도메인 맞춤 지표는 Model A를 고른다
같은 두 모델을 맞춤 지표로 다시 채점하자 결론이 뒤집혔다.
| 지표 | Model A | Model B |
|---|---|---|
| Trend Correlation (↑ 좋음) | 0.60 | 0.00 |
| Activity (↑ 좋음) | 0.428 | 0.40 |
| Mean Directional Accuracy (↑ 좋음) | 49.4% | 1.18% |
Model B의 추세 상관 0.00은 §3의 진단을 확증한다. B는 사실상 평평한 선을 그리므로 실제 신호와 함께 움직이지 않는다. 방향 정확도 1.18%는 거의 움직이지 않는 예측이 움직이는 목표의 방향을 맞힐 일이 없다는 당연한 귀결이다. 반면 Model A는 실제 공정 거동을 따라간다 — 이탈에 선행하는 초기 움직임을 잡아낸다는 것, 그것이 이 시스템의 존재 이유 전체다.
6. 지표 요약 — 강점과 주의점
맞춤 지표를 쓴다고 표준 지표를 버리는 것은 아니다. 각 지표는 재는 대상이 다르고, 저마다 약점이 있다. 함께 읽어야 판정이 견고해진다.
| 지표 | 분류 | 강점 | 주의점 |
|---|---|---|---|
| MAE | 기본 회귀 | 직관적 해석, 이상치에 덜 민감 | 안정/이탈 구분 없이 평균화됨 |
| MSE / RMSE | 기본 회귀 | 큰 오차에 페널티, 원단위 해석(RMSE) | 극단 구간에 지배·과대평가되기 쉬움 |
| R² | 기본 회귀 | 평균 대비 설명력을 직관적으로 | 분산이 작은 안정 구간에서 수치 불안정 |
| MAPE | 기본 회귀 | 스케일 독립 비율 평가 | 실제값이 0 근처면 발산7 |
| Adjusted MAE / R² | 그룹 조정 | 이탈/안정 그룹 간 균형 반영 | 그룹 표본 수 불균형 시 가중치에 민감 |
| Trend Corr | 그룹 조정 | 그룹별 추세 유사도를 균형 있게 | 구간이 너무 짧으면 상관계수가 불안정 |
| MDA | 특화 | 방향(증감) 일치·전환점 포착 | 변화의 크기는 무시 |
핵심은 어느 지표도 단독으로 완전하지 않다는 점이다. MDA는 방향은 보되 크기를 못 보고, RMSE는 크기는 보되 방향을 못 본다. 여러 지표를 함께 두고, 그중 무엇이 이 과제의 목적과 정렬되는지를 먼저 정하는 것이 지표 설계다.
7. 이런 재정의는 낯설지 않다 — 다른 산업의 대안 지표들
여기서 설계한 다섯 지표가 특별한 발명은 아니다. "표준 회귀 지표만으로는 이 도메인의 '좋음'을 잴 수 없다"는 문제의식은 제조 품질관리, 기상 예보, 수요 예측이 이미 각자의 방식으로 다뤄온 문제다. 이 프로젝트의 접근을 그 계보 위에 놓아본다.
| 대안 지표 | 어느 분야에서 쓰이나 | 무엇을 재는가 | 이 글의 지표와의 관계 |
|---|---|---|---|
| 공정능력지수 Cpk / Ppk | 제조 품질관리(SPC) | 공정 산출물이 규격 상하한(USL/LSL) 안에 변동성 대비 얼마나 여유 있게 들어오는가 | 우리가 다룬 "이탈(off-spec)"을 공정 쪽에서 재는 이미 표준화된 방법이다. 이 글은 같은 문제의식을 공정 산출물이 아니라 예측 모델의 품질에 적용한 셈이다.8 |
| POD / FAR / CSI (탐지확률 / 오경보율 / 위협점수) | 기상 예보 검증 | 드문 사건(호우·태풍 등)을 맞혔는지를 이진 탐지 문제로 보고, 맞힘·누락·오경보를 각각 분리해서 잰다 | Adjusted 지표·MDA와 같은 문제의식이다 — 희귀 사건을 평균에 묻지 않고 따로 채점한다. 이탈을 "탐지"로 재정의하면 그대로 가져다 쓸 수 있는, 이미 성숙한 검증 체계다.9 |
| MASE (Mean Absolute Scaled Error) | 수요·시계열 예측(M-competition 계열) | naive(단순 반복) 예측 대비 오차를 스케일링해 척도 독립적으로 비교 | MAPE가 실제값 0 근처에서 발산하는 문제를, 우리와는 다른 방식(naive 대비 비율)으로 푼 표준 대안이다.7 |
| CRPS (Continuous Ranked Probability Score) | 확률적 예측 평가(기상·에너지 수요) | 점 추정이 아니라 확률분포 전체의 보정(calibration)과 첨예도(sharpness)를 동시에 채점 | 이 글의 다섯 지표는 전부 점 추정 기준이다. 모델이 확률분포를 낸다면, CRPS는 다음 단계로 검토할 확장 지점이다.10 |
이 목록의 공통점은 하나다. 표준 지표가 자기 도메인의 '좋음'을 재지 못한다고 판단되면, 그 도메인은 자기 방식대로 새 지표를 만들어 왔다. 제조업은 공정능력지수로, 기상학은 탐지 지표로, 수요예측은 스케일-프리 지표로. 이 프로젝트에서 한 일은 이 계보에 이탈 탐지용 시계열 지표 하나를 추가한 것에 가깝다.
8. 무엇을 조심해야 하나 (한계)
이 접근에도 분명한 한계가 있다. 정직하게 밝힌다.
- 짧은 구간에서 상관계수는 불안정하다. 이탈 구간은 드물어 표본이 적고, 표본이 적을수록 Trend Correlation은 흔들린다. 짧은 창에서 얻은 높은 상관을 과신하면 안 된다.
- 가중치에는 임의성이 있다. Adjusted 지표는 이탈 구간에 얼마의 가중을 줄지 정해야 하는데, 이 가중치 자체가 판단이다. 가중을 바꾸면 순위가 바뀔 수 있으므로, 가중의 근거를 함께 기록해야 한다.
- 단일 기간·단일 공정의 결과다. 이 반전은 특정 데이터에서 관찰된 것이며, 다른 조건에서 그대로 재현된다고 단정하지 않는다.
- 맞춤 지표도 대리(proxy)일 뿐이다. "이탈을 미리 본다"를 완벽히 포착하는 단일 수식은 없다. 우리가 만든 것은 그 목적에 더 가까운 대리 지표들의 묶음이다.
우리가 "설계했다"고 말할 수 있는 것은 지표 체계와 그에 따른 모델 선택 판단이며, "이 지표가 정답"이라거나 "성능이 보장된다"는 표현은 쓰지 않는다.
9. 일반화된 패턴
이 작업의 재사용 가능한 교훈은 하나로 압축된다.
모델을 고르기 전에 '좋음'을 먼저 정의하라. 그 정의가 과제 목적과 어긋나 있으면, 최적화는 프로젝트를 잘못된 방향으로 끌고 간다.
이는 이 공정에만 통하는 이야기가 아니다. 측정 지표가 목표가 되는 순간 그것은 좋은 측정이기를 그친다는 것은 Goodhart의 법칙으로 널리 알려져 있고,11 ML에서도 대리 지표를 목표로 삼아 과최적화하면 실제 목적과 어긋나는 현상으로 반복 관찰된다. 잘못 설정된 KPI는 모델을 정교하게 만들수록 오히려 더 정교하게 틀린 방향으로 데려간다.
그래서 이 과제의 진짜 산출물은 모델이 아니라 '좋음'의 정의였다. 사람이 "좋다"고 느끼는 도메인 직관을 분석해 컴퓨터가 이해할 수 있는 수식으로 옮기는 것 — 이것이 품질 예측기를 이탈에 대한 선제적 조기경보 도구로 바꾼 지점이다. 응용 ML에서 가장 레버리지가 큰 작업이 반드시 모델링인 것은 아니다. 표준 스코어보드가 잘못된 거동을 보상하고 있음을 알아채고, 사업이 실제로 필요로 하는 거동을 보상하는 스코어보드를 설계하는 일 — 여기에 더 큰 레버리지가 있을 때가 있다.
10. 실무 체크리스트
- □이 과제에서 "쓸모 있는 모델"의 정의를 한 문장으로 적었는가 (예: 평균 오차 최소가 아니라 이탈 조기 포착)
- □위험·가치가 몰린 구간이 신호의 다수인지 소수(희귀 사건)인지 확인했는가
- □표준 지표의 결론과 도메인 직관이 충돌하는지 눈으로(시계열 플롯) 대조했는가
- □R² ≈ 0인 모델이 사실상 평균/평평 예측기는 아닌지 점검했는가
- □방향(MDA)·형태(Trend Corr)·크기(RMSE)를 각각 재는 지표를 함께 두었는가
- □물리적 시간 지연이 있다면 lag를 허용한 오차를 함께 봤는가
- □희귀 구간에 가중을 준다면 그 가중의 근거를 기록했는가
- □단일 집계 숫자 하나로 모델을 고르지 않았는가 (Anscombe)
- □선택한 지표가 과제 목적과 정렬되는지, 그 근거를 현업과 합의했는가
11. 참고 자료
- Branco, P., Torgo, L. & Ribeiro, R. P. (2016/2019). imbalanced/utility-based regression 관련 연구(relevance 가중 오차, SERA). — §3·§4의 "희귀 구간이 평균에 희석된다"와 Adjusted(relevance 가중) 지표의 근거. 불균형·효용 기반 회귀에서 관심 대상이 드문 문제를 정식화한 연구 계열을 참고해 재구성했다.
- Hastie, T., Tibshirani, R. & Friedman, J., The Elements of Statistical Learning, 2nd ed., §2.4. — 제곱오차 손실에서 최적 상수 예측은 평균, 최적 예측은 조건부 기댓값 E[Y|X]라는 통계적 결정이론의 표준 결과.
- Kvålseth, T. O. (1985). "Cautionary Note about R²." The American Statistician, 39(4), 279–285. — §3의 R² 해석(R²≈0은 평균 예측과 동등, 음수는 그보다 나쁨)의 근거.
- Anscombe, F. J. (1973). "Graphs in Statistical Analysis." The American Statistician, 27(1), 17–21. — §3의 "집계 통계량이 같아도 거동은 다르다" 논거.
- Pesaran, M. H. & Timmermann, A. (1992). "A Simple Nonparametric Test of Predictive Performance." Journal of Business & Economic Statistics, 10(4), 461–465. — §4·§5의 방향 정확도(MDA) 서술의 근거. 특정 논문 표를 전재하지 않았다.
- Berndt, D. J. & Clifford, J. (1994). "Using Dynamic Time Warping to Find Patterns in Time Series." KDD Workshop. — §3·§4의 lag-aware(시점 지연 허용) 오차 발상의 근거.
- Hyndman, R. J. & Koehler, A. B. (2006). "Another look at measures of forecast accuracy." International Journal of Forecasting, 22(4), 679–688. — §6의 MAPE 발산 및 척도 의존성 논의의 근거, §7의 MASE 언급의 근거.
- Kane, V. E. (1986). "Process Capability Indices." Journal of Quality Technology, 18(1), 41–52. — §7의 공정능력지수(Cpk/Ppk) 서술의 근거.
- Wilks, D. S., Statistical Methods in the Atmospheric Sciences (3rd ed.), Ch. 8 "Forecast Verification". — §7의 POD/FAR/CSI 서술의 근거.
- Gneiting, T. & Raftery, A. E. (2007). "Strictly Proper Scoring Rules, Prediction, and Estimation." Journal of the American Statistical Association, 102(477), 359–378. — §7의 CRPS 서술의 근거.
- Goodhart의 법칙 — Strathern, M. (1997)의 대중적 재정식화 및 Manheim & Garrabrant (2018), Categorizing Variants of Goodhart's Law. — §9의 "지표가 목표가 되면 좋은 지표이기를 그친다"의 근거.
- 이전글expand_less
- 다음글expand_more
- 연속 공정에서 처치 효과와 confounder 분리하기


