목차2. 데이터로 배우고 예측하기
Chapter 02 · 예시를 보고 규칙을 찾아 새것에 써 보기
데이터로 배우고 예측하기
훈련 데이터의 예시에서 패턴을 찾고 처음 보는 입력을 예측하는 과정을 살펴본다.
- 훈련 데이터와 예측을 구별한다.
- 처음 보는 예시로 시험하는 이유를 말한다.
- 치우친 데이터가 결과에 미치는 영향을 찾는다.
친구가 과일 카드 여러 장을 “달다”와 “새콤하다”로 나눠 놓았습니다. 여러분은 색, 냄새, 이름을 보며 친구가 사용한 기준을 짐작합니다. 그리고 처음 보는 과일 카드를 어느 쪽에 둘지 골라 봅니다. 기계학습도 완전히 같지는 않지만, 예시에서 패턴을 찾고 새 입력에 적용한다는 뼈대는 비슷합니다.
예시 묶음에서 패턴 찾기
사진 분류기를 만들 때 사람은 “귀가 삼각형이면 고양이” 같은 모든 규칙을 적기 어렵습니다. 대신 고양이와 고양이가 아닌 사진, 그리고 각 사진의 정답표를 준비할 수 있습니다. 모델은 예측과 정답의 차이가 줄어들도록 내부 숫자를 조금씩 바꿉니다.
기계학습 모델은 사람이 모든 규칙을 적는 대신 여러 예시에서 유용한 패턴을 찾도록 조정됩니다. AI4K12 InitiativeFive Big Ideas in Artificial Intelligence and Grade Band Progression ChartsBig Idea 3: Learning, grade-band progression charts
여기서 데이터는 그냥 많이 모으면 되는 재료가 아닙니다. 사진이 흐린지, 정답표가 정확한지, 실제로 만날 고양이의 모습이 들어 있는지가 중요합니다. 목표도 사람이 정합니다. “동물 종류 맞히기”와 “보호소에서 치료가 급한 동물 찾기”는 같은 사진을 보더라도 필요한 정답과 실수의 무게가 다릅니다.
처음 보는 예시가 진짜 시험
시험 문제와 답을 미리 모두 외운 학생은 그 시험에서 높은 점수를 받을 수 있습니다. 하지만 숫자와 상황이 바뀐 새 문제를 풀지 못하면 원리를 배웠다고 말하기 어렵습니다. 모델도 훈련에 쓴 자료에서만 잘하면 부족합니다.
훈련에 쓰지 않은 새 예시로 확인해야 모델이 예시를 외운 것이 아니라 새로운 입력에도 패턴을 적용하는지 알 수 있습니다. AI4K12 InitiativeFive Big Ideas in Artificial Intelligence and Grade Band Progression ChartsBig Idea 3: Learning, training and testing progression
그래서 자료를 훈련용과 시험용으로 나눕니다. 시험용 정답은 학습 중에 보여 주지 않습니다. 그래도 교실 시험과 다른 점이 있습니다. 실제 세상은 계속 바뀝니다. 겨울 사진만 배운 자전거 탐지기는 여름의 새로운 자전거 모양을 놓칠 수 있어요. 배포한 뒤에도 여러 상황에서 다시 확인해야 합니다.
데이터가 좁으면 배움도 좁다
손 씻기 자세를 알려 주는 카메라가 어른의 손 사진만 배웠다면 어린이의 작은 손이나 보조 기구를 쓰는 손에서 잘 작동하지 않을 수 있습니다. 전체 평균 점수가 높아도 어떤 사람에게는 계속 실패할 수 있습니다.
훈련 데이터에 어떤 사람이나 상황이 빠지면 모델의 성능도 그 집단이나 상황에서 나빠질 수 있습니다. National Institute of Standards and TechnologyArtificial Intelligence Risk Management Framework (AI RMF 1.0)pp. 14–15, fair with harmful bias managed
이 문제를 고치려면 “모델이 편견을 가졌다”고만 말하기보다 빠진 자료와 잘못 붙은 정답, 목표의 문제를 찾습니다. 더 다양한 자료를 정당한 방법으로 모으고, 집단별 성능을 따로 확인하고, AI 결과를 사람이 되돌릴 수 있게 해야 합니다. 개인정보를 함부로 더 모으는 것이 답은 아닙니다. 필요한 만큼만 안전하게 다루는 조건도 함께 지켜야 합니다.
확인 문제
참고문헌
- 교육 컨소시엄
AI4K12 Initiative. Five Big Ideas in Artificial Intelligence and Grade Band Progression Charts. Living curriculum guidance, accessed 2026-07-24, 2020.
원문 - 독립 공공기관
OECD · European Union. Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education. Final, 64 pages, 2026-06-18.
원문 - 독립 공공기관
National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework (AI RMF 1.0). NIST AI 100-1, 2023-01-26.
원문
외부 기술·연령 적합성 검토 대기 · 검토 게이트 #12