기본 트랙고등학생 이상·비전공 성인
같은 주제, 쉬운 트랙으로
목차2. 데이터로 배우고 예측하기
  1. 1. AI란 무엇인가
  2. 2. 데이터로 배우고 예측하기
  3. 3. 모델이 답을 고르는 방법
  4. 4. 생성형 AI와 언어 모델
  5. 5. AI가 틀리는 이유와 검증법
  6. 6. RAG와 출처 기반 답변
  7. 7. AI를 책임 있게 사용하기

Chapter 02 · 최적화와 일반화를 구분하는 최소한의 틀

데이터로 배우고 예측하기

학습을 오차를 줄이는 과정으로 보고 훈련·검증·시험과 분포 변화의 의미를 연결한다.

7출처 3확인 문제 1개
전체 7장 중 2
기본 트랙 학습 진도
읽고 나면
  • 학습과 추론을 구별한다.
  • 훈련·검증·시험 자료의 역할을 설명한다.
  • 일반화 실패와 분포 변화를 진단한다.

기계학습을 “데이터에서 스스로 배운다”라고만 설명하면 목표 함수, 데이터 구성, 평가자의 선택이 사라집니다. 학습은 마법 같은 자율 학습이 아니라 정해진 목표 아래 오차를 줄이는 계산입니다. 중요한 질문은 무엇을 줄였는지, 어떤 자료에서 줄였는지, 그 감소가 실제 환경에서도 이어지는지입니다.

오차를 줄이는 학습

지도학습의 간단한 형태를 생각해 봅시다. 입력 (x)와 원하는 정답 (y)의 쌍을 준비하고, 모델 (f_\theta(x))의 예측이 정답과 얼마나 다른지 손실 함수로 계산합니다. 학습 알고리즘은 이 손실을 줄이는 방향으로 매개변수 (\theta)를 반복해서 조정합니다.

학습은 정해진 목표와 데이터에 대해 손실을 줄이도록 모델의 조정 가능한 값을 바꾸는 최적화 과정으로 볼 수 있습니다. AI4K12 InitiativeFive Big Ideas in Artificial Intelligence and Grade Band Progression ChartsBig Idea 3: Learning, high-school progression on model training

손실 함수는 가치 판단을 포함합니다. 평균 오차를 줄일지, 큰 오류에 더 무거운 벌점을 줄지, 어떤 집단의 오류를 따로 볼지에 따라 모델이 선호하는 해가 달라집니다. 비지도학습이나 강화학습은 정답표의 모양이 다르지만, 표현이나 보상을 무엇으로 삼는지 사람이 설계한다는 점은 같습니다.

훈련 성능과 일반화

훈련 오차가 매우 낮아도 새 입력의 오차가 낮다는 보장은 없습니다. 모델이 우연한 배경, 파일 이름, 촬영 장비처럼 훈련 자료에만 있는 단서를 이용했을 수 있습니다. 이를 발견하려고 훈련 자료와 분리한 검증 자료로 설정을 고르고, 마지막 시험 자료로 선택이 끝난 뒤의 성능을 추정합니다.

훈련 자료의 성능만으로 배치 환경의 성능을 추정할 수 없으므로 검증·시험 자료와 실제 맥락에서 일반화를 평가해야 합니다. National Institute of Standards and TechnologyArtificial Intelligence Risk Management Framework (AI RMF 1.0)pp. 28–31, MEASURE function and test sets representative of deployment

시험 자료도 완전한 미래는 아닙니다. 같은 수집 과정에서 무작위로 나눈 시험 세트는 새로운 병원, 다른 언어, 다음 해의 사용자를 대표하지 못할 수 있습니다. 따라서 평균 지표 하나 외에 오류 사례, 집단별 성능, 민감도 분석, 배포 후 모니터링이 필요합니다. 높은 벤치마크 점수는 명시된 조건에서의 증거이지 모든 상황의 보증서가 아닙니다.

데이터 분포와 대표성

대출 연체 예측 모델이 안정된 고용 형태가 많던 시기의 자료로 학습되었다고 합시다. 경제 충격 뒤 고용 구조가 바뀌면 입력의 비율뿐 아니라 같은 입력과 결과의 관계도 달라질 수 있습니다. 이를 넓게 분포 변화라고 부릅니다.

시간·지역·사용자 구성이 바뀌어 실제 입력 분포가 훈련 분포와 달라지면 기존 평가 성능이 유지되지 않을 수 있습니다. National Institute of Standards and TechnologyArtificial Intelligence Risk Management Framework (AI RMF 1.0)pp. 22–31, MAP 3 and MEASURE 2 on context and emergent risks

대표성은 단순히 모든 사람을 같은 수로 모으는 문제가 아닙니다. 사용 목적, 오류의 영향, 역사적 불평등을 함께 봐야 합니다. 과거의 인사 평가를 정답으로 삼으면 과거 차별이 정답표에 들어갈 수 있습니다. 데이터가 많아도 측정 대상과 대리 변수가 어긋나면 잘못된 목표를 정밀하게 학습합니다. 데이터 계보, 수집 동의, 누락과 오류, 배포 맥락을 문서화해야 하는 이유입니다.

읽은 뒤 1분

확인 문제

훈련 정확도는 높은데 실제 서비스 정확도가 낮을 때 가장 타당한 첫 가설은?
이 장의 검증 기록

참고문헌

전체 출처 인덱스
  1. 교육 컨소시엄

    AI4K12 Initiative. Five Big Ideas in Artificial Intelligence and Grade Band Progression Charts. Living curriculum guidance, accessed 2026-07-24, 2020.

    원문
  2. 독립 공공기관

    OECD · European Union. Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education. Final, 64 pages, 2026-06-18.

    원문
  3. 독립 공공기관

    National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework (AI RMF 1.0). NIST AI 100-1, 2023-01-26.

    원문

외부 기술·연령 적합성 검토 대기 · 검토 게이트 #12