3  들어가기: 데이터와 모형

학습 목표
  • 고전적 프로그래밍과 머신러닝의 차이를 설명할 수 있다
  • 인공지능, 머신러닝, 딥러닝의 관계를 이해한다
  • 데이터의 구성요소(변수, 데이터 포인트, 독립변수, 종속변수)를 구분할 수 있다
  • 정형 데이터와 비정형 데이터를 구분하고, 데이터의 크기를 \((n, p)\)로 말할 수 있다
  • 숫자형·순서형·범주형 변수를 구분할 수 있다
  • 모형(model)과 파라미터(parameter)의 개념을 이해한다
  • 파라미터와 하이퍼파라미터의 차이를 설명할 수 있다
  • 모형의 학습이 파라미터 최적화임을 이해한다
  • 회귀와 분류 문제를 구분할 수 있다
  • 지도학습과 비지도학습의 차이를 설명할 수 있다
  • 딥러닝이 각광받는 이유를 세 가지 이상 제시할 수 있다

3.1 데이터 기반 문제해결

3.1.1 고전적 프로그래밍 vs 머신러닝

문제를 해결하는 방식에는 두 가지 접근이 있다.

고전적 프로그래밍 (Classical Programming)

  • 사람이 직접 규칙(Rules)을 만들고, 데이터를 넣으면 답을 얻는다
  • 예: “기온이 0도 이하이면 빙판 주의보를 발령한다”

머신러닝 (Machine Learning)

  • 사람이 데이터(Data)정답(Answers)을 주면, 컴퓨터가 규칙(Rules)을 찾아낸다
  • 예: 과거 기상데이터와 사고기록을 주면, 어떤 조건에서 사고가 나는지 규칙을 학습
입력 출력
고전적 프로그래밍 규칙 + 데이터
머신러닝 데이터 + 답 규칙

3.1.2 왜 머신러닝이 필요한가?

규칙을 사람이 직접 만들기 어려운 경우가 많다.

  • 사진 속 동물이 고양이인지 개인지 판별하는 규칙은?
  • 이메일이 스팸인지 아닌지 판별하는 규칙은?
  • 내일 주가가 오를지 내릴지 판별하는 규칙은?

이런 문제들은 데이터로부터 패턴을 자동으로 학습하는 것이 효과적이다.


3.2 인공지능, 머신러닝, 딥러닝

3.2.1 세 개념의 관계

인공지능 (Artificial Intelligence)

컴퓨터로 하여금 사람의 생각과 행동을 모사(mimic)하도록 하는 모든 기술.

머신러닝 (Machine Learning)

명시적으로 프로그래밍하지 않아도 컴퓨터가 데이터로부터 규칙을 스스로 발견하도록 하는 것.

딥러닝 (Deep Learning)

인공신경망 구조를 사용하여 데이터로부터 패턴을 추출하는 머신러닝의 한 분야.

세 개념의 포함 관계: 인공지능 ⊃ 머신러닝 ⊃ 딥러닝

인공지능 (Artificial Intelligence) 머신러닝 (Machine Learning) 딥러닝 (Deep Learning) 규칙 기반 AI 전문가 시스템 SVM Random Forest CNN, RNN, Transformer

3.3 데이터란 무엇인가

3.3.1 데이터의 정의

데이터 (Data)

과거에 일어난 사실들을 특정 형식에 맞게 기록해놓은 자료.

3.3.2 예시 데이터

어떤 기업 내 사원 8명에 대한 데이터를 다음과 같이 수집하였다.

코드
import pandas as pd

df = pd.DataFrame({
    '사원': [1, 2, 3, 4, 5, 6, 7, 8],
    '경력 (년)': [1.5, 2.5, 4.2, 5.1, 6.7, 8.3, 9.5, 13.0],
    '연봉 ($)': [31000, 39000, 43000, 49000, 54000, 67000, 92000, 129000],
})
df.to_html(index=False, border=0)
표 3.1: 예시 데이터: 사원 경력과 연봉
사원 경력 (년) 연봉 ($)
1 1.5 31000
2 2.5 39000
3 4.2 43000
4 5.1 49000
5 6.7 54000
6 8.3 67000
7 9.5 92000
8 13.0 129000

3.3.3 데이터의 구성요소

데이터는 열(column)행(row)의 조합으로 표현된다.

변수 (Variable)

데이터의 특성을 구분 짓는 이름. 테이블의 열(column)에 해당한다.

  • 위 예시에서 변수: “경력”, “연봉”
데이터 포인트 (Data Point)

각 특성에 따라 기록된 서로 다른 개체. 테이블의 행(row)에 해당한다.

  • 위 예시에서 데이터 포인트: 사원 1, 사원 2, …, 사원 8 (총 8개)
  • 다른 이름: 관측치(observation), 샘플(sample)

3.3.4 정형 데이터와 비정형 데이터

정형 데이터 (Tabular Data)

행과 열로 정리된 표 형태의 데이터. 각 행이 하나의 개체, 각 열이 하나의 변수다.

  • 예: 엑셀 시트, 데이터베이스 테이블, 설비 센서 로그, 생산 실적표
  • 산업 현장에서 가장 흔한 형태다
비정형 데이터 (Unstructured Data)

표로 정리되지 않는 데이터. 무엇이 열인지 정해져 있지 않다.

  • 예: 사진, 문장, 음성, 동영상
  • “이 사진의 3번째 열의 값”이라는 말이 성립하지 않는다

이 수업은 정형 데이터에서 출발해(1~4주) 이미지(5~9주), 텍스트(10~12주)로 옮겨간다. 비정형 데이터를 신경망에 넣으려면 먼저 숫자로 바꾸는 방법이 필요한데, 그 방법이 각각 콘볼루션(이미지)과 임베딩(텍스트)이다.


3.4 독립변수와 종속변수

3.4.1 정의

데이터를 활용하여 예측이나 추론을 하려면, 변수 간의 역할 구분이 필요하다.

종속변수 (Dependent Variable)

독립변수에 영향을 받는 특성. 우리가 예측하고자 하는 대상.

  • 소문자 \(y\)로 표기
  • 다른 이름: target variable, output variable, label, 반응변수
  • 위 예시에서: 연봉
독립변수 (Independent Variable)

종속변수에 영향을 주는 것으로 여겨지는 특성들.

  • 대문자 \(X\)로 표기
  • 다른 이름: predictor, input variable, feature, regressor
  • 위 예시에서: 경력

3.4.2 데이터의 크기 — \((n, p)\)

데이터를 말할 때는 항상 두 개의 숫자로 크기를 말한다.

  • 데이터 포인트(행)의 수를 \(n\)
  • 독립변수(열)의 수를 \(p\)

이렇게 두면 \(X\)\(y\)의 모양이 정해진다.

기호 모양 왜 그렇게 쓰는가
\(X\) \(n\)행 × \(p\)열의 표(행렬) 값이 가로세로로 펼쳐져 있어서 대문자
\(y\) 길이 \(n\)한 줄(벡터) 행마다 정답이 하나씩, 한 줄이라 소문자

위 사원 데이터는 \(n = 8\) (사원 8명), \(p = 1\) (경력 하나)이다. 만약 경력·부서·평가등급을 모두 쓴다면 \(p = 3\)이 된다.

\((n, p)\) 감각은 이 수업 내내 쓰인다. Ch02에서 신경망의 입력층 노드 수가 곧 \(p\)이고, Ch04에서 범주형 변수를 원-핫 인코딩하면 \(p\)가 늘어난다.

3.4.3 수치 예시

위 사원 데이터에서 독립변수와 종속변수를 구분하면:

코드
import pandas as pd

df = pd.DataFrame({
    '사원': [1, 2, 3, 4, 5, 6, 7, 8],
    '$X$ (경력)': [1.5, 2.5, 4.2, 5.1, 6.7, 8.3, 9.5, 13.0],
    '$y$ (연봉)': [31000, 39000, 43000, 49000, 54000, 67000, 92000, 129000],
})
df.to_html(index=False, border=0)
표 3.2: 독립변수(X)와 종속변수(y) 구분
사원 \(X\) (경력) \(y\) (연봉)
1 1.5 31000
2 2.5 39000
3 4.2 43000
4 5.1 49000
5 6.7 54000
6 8.3 67000
7 9.5 92000
8 13.0 129000

질문: “경력이 7년인 사원의 연봉은 얼마일까?”

이 질문에 답하려면, \(X\)\(y\)의 관계를 수학적으로 표현하는 모형이 필요하다.


3.5 모형 (Model)

3.5.1 정의

모형 (Model)

독립변수(\(X\))와 종속변수(\(y\))의 관계에 대한 가설을 수학적으로 표현한 것.

같은 데이터라 할 지라도 \(X\)\(y\)의 관계에 대한 다양한 가설을 생각해 볼 수 있다.

3.5.2 모형의 예시

코드
import pandas as pd

df = pd.DataFrame({
    '가설': [
        '연봉이 경력에 비례하여 증가',
        '연봉이 경력의 제곱에 비례하여 증가',
        '연봉이 경력의 n차식으로 표현',
    ],
    '수식': [
        '$y = w_0 + w_1 x$',
        '$y = w_0 + w_1 x + w_2 x^2$',
        '$y = w_0 + w_1 x + w_2 x^2 + ⋯ + w_n x^n$',
    ],
    '파라미터': [
        '$w_0, w_1$',
        '$w_0, w_1, w_2$',
        '$w_0, w_1, …, w_n$',
    ],
})
df.to_html(index=False, border=0, escape=False)
표 3.3: 같은 데이터에 대한 다양한 모형 가설
가설 수식 파라미터
연봉이 경력에 비례하여 증가 \(y = w_0 + w_1 x\) \(w_0, w_1\)
연봉이 경력의 제곱에 비례하여 증가 \(y = w_0 + w_1 x + w_2 x^2\) \(w_0, w_1, w_2\)
연봉이 경력의 n차식으로 표현 \(y = w_0 + w_1 x + w_2 x^2 + ⋯ + w_n x^n\) \(w_0, w_1, …, w_n\)

3.5.3 모형의 종류

\(X\)\(y\)의 관계에 대한 가설에 따라 다양한 종류의 모형이 존재한다.

모형 특징
회귀모형 \(y = w_0 + w_1 x\)
로지스틱회귀모형 확률을 통한 분류
K-Nearest Neighbor 가까운 이웃의 다수결
Support Vector Machine 최대 마진 분류
Random Forest 의사결정나무 앙상블
딥뉴럴네트워크 다층 퍼셉트론 구조

3.6 파라미터 (Parameter)

3.6.1 정의

파라미터 (Parameter)

모형 안에서 독립변수(\(X\))와 종속변수(\(y\)) 간의 관계를 표현하기 위해 조절할 수 있는 매개변수.

파라미터의 값이 달라지면, 같은 모형이라도 다른 예측을 한다.

3.6.2 파라미터 vs 하이퍼파라미터

모형에 관련된 숫자가 전부 학습으로 정해지는 것은 아니다.

하이퍼파라미터 (Hyperparameter)

학습으로 정해지지 않고, 사람이 미리 정해 주어야 하는 값.

누가 정하는가
파라미터 데이터가 정한다 (= 학습) 가중치 \(w_1\), 편향 \(w_0\)
하이퍼파라미터 사람이 정한다 다항식의 차수, 은닉층의 노드 수(Ch02), 학습률·배치 크기(Ch04)

\(y = w_0 + w_1 x + w_2 x^2\)에서 “2차식으로 하자”는 사람의 결정(하이퍼파라미터)이고, \(w_0, w_1, w_2\)의 값은 데이터가 정한다(파라미터). 하이퍼파라미터를 잘못 고르면 학습을 아무리 잘해도 좋은 모형이 나오지 않는다 — Ch04에서 확인한다.

3.6.3 수치 예시: 파라미터에 따른 예측 변화

모형 \(y = w_0 + w_1 x\)에서 파라미터를 다르게 설정하면 같은 경력(7년)에 대해 다른 연봉을 예측한다.

코드
import pandas as pd
import numpy as np

rows = []
for name, b0, b1 in [('A', 20000, 5000), ('B', 10000, 8000), ('C', 15000, 7000)]:
    y_hat = b0 + b1 * 7
    rows.append({
        '후보': name,
        '$w_0$': f'{b0:,}',
        '$w_1$': f'{b1:,}',
        '예측식': f'{b0} + {b1} × 7',
        '예측 연봉': f'${y_hat:,}',
    })

pd.DataFrame(rows).to_html(index=False, border=0, escape=False)
표 3.4: 파라미터에 따른 예측값 변화 (경력 7년일 때)
후보 \(w_0\) \(w_1\) 예측식 예측 연봉
A 20,000 5,000 20000 + 5000 × 7 $55,000
B 10,000 8,000 10000 + 8000 × 7 $66,000
C 15,000 7,000 15000 + 7000 × 7 $64,000

어떤 파라미터가 “좋은” 것인지 판단하려면, 데이터를 가장 잘 설명하는 파라미터를 찾아야 한다.


3.7 모형의 학습 (Learning)

3.7.1 학습이란

학습 (Learning)

주어진 데이터를 가장 잘 나타내는 파라미터를 찾아나가는 과정.

  • 모형: \(X\)\(y\)에 대한 수학적 관계
  • 학습: 그 관계를 가장 잘 표현하는 파라미터를 데이터로부터 결정

인터랙티브 — 파라미터를 조절하여 데이터에 맞는 직선을 찾아보세요

\(w_0\) (절편)과 \(w_1\) (기울기)을 조정하면서, 데이터를 가장 잘 설명하는 직선을 찾아보세요. 잔차 제곱합(L)이 최소가 되는 파라미터가 최적입니다.

직선으로 충분한가? 슬라이더를 아무리 조절해도 이 데이터의 모든 점을 지나는 직선은 없다. 실제로 이 사원 데이터는 경력이 길어질수록 연봉이 가팔라지는 모양이라, 직선보다 곡선이 더 잘 맞는다. 그렇다면 2차식, 3차식으로 차수를 계속 올리면 항상 좋아질까? — 이 질문의 답은 Ch04의 과적합에서 만난다. (차수는 사람이 정하는 하이퍼파라미터였음을 기억하라.)


3.8 모형의 이용: 예측과 추론

3.8.1 예측 (Prediction)

예측 (Prediction)

새로운 데이터의 \(x\)값이 주어질 때, 학습된 파라미터를 이용하여 \(y\)값을 예측하는 것.

학습된 모형이 \(y = 15000 + 8000x\)라면:

코드
import pandas as pd

rows = []
for x_new in [4, 6, 8, 10]:
    y_pred = 15000 + 8000 * x_new
    rows.append({
        '경력 (년)': x_new,
        '예측식': f'15000 + 8000 × {x_new}',
        '예측 연봉 ($)': f'{y_pred:,}',
    })

pd.DataFrame(rows).to_html(index=False, border=0, escape=False)
표 3.5: 학습된 모형을 이용한 예측
경력 (년) 예측식 예측 연봉 ($)
4 15000 + 8000 × 4 47,000
6 15000 + 8000 × 6 63,000
8 15000 + 8000 × 8 79,000
10 15000 + 8000 × 10 95,000

3.8.2 추론 (Inference)

추론 (Inference)

\(y\)를 예측하는 데 있어 \(X\)의 중요한 특성(feature)이 무엇인지, 그리고 그 방향성에 대하여 설명하는 것.

  • 모든 모형에서 추론이 가능하지는 않다
  • 명확한 수학적 형태를 가진 모형에서만 가능

\(y = 15000 + 8000x\)에서 추론할 수 있는 것:

파라미터 추론 내용
\(w_0 = 15000\) 절편 회사에 처음 입사 시 연봉이 약 $15,000
\(w_1 = 8000\) 기울기 1년 경력이 늘 때마다 연봉이 약 $8,000씩 인상
주의 — 추론은 인과가 아니다

위 문장은 “이 데이터에서 경력과 연봉이 함께 움직였다”는 관찰이다. 경력이 연봉을 올린 원인이라는 뜻이 아니다.

경력이 긴 사람이 애초에 능력이 좋았을 수도 있고, 두 변수 모두 나이의 영향을 받았을 수도 있다. 인과를 주장하려면 실험 설계가 필요하다 — 데이터를 관찰하는 것만으로는 알 수 없다. 모형이 알려주는 것은 언제나 연관성이지 인과가 아니다.


3.9 변수의 종류

3.9.1 숫자형 변수 (Numerical Variable)

숫자형 변수

실수나 정수로 표현할 수 있으며, 값의 차이가 의미를 가지는 변수.

  • 예: 나이(56, 24, …), 온도(27.2, 24.0, …), 연봉(40000, …)

3.9.2 범주형 변수 (Categorical Variable)

범주형 변수

실수로 표현할 수 없으며, 분절된 서로 다른 값을 가지는 변수.

  • 예: 성별 {남자, 여자}, 브랜드 {삼성, 애플}, 결혼여부 {yes, no}
  • 서로 다른 값에 숫자를 부여하더라도(남=1, 여=2) 숫자 간의 차이는 무의미

3.9.3 순서형 변수 (Ordinal Variable)

범주형과 숫자형 사이에 하나가 더 있다. 실무에서 매우 자주 나오는데, 놓치기 쉽다.

순서형 변수

범주형이지만 순서가 있는 변수. 크기 비교는 되지만, 간격은 의미가 없다.

  • 예: 학점 {A, B, C}, 만족도 {매우 불만 … 매우 만족}, 제품 등급 {1등급, 2등급, 3등급}
  • “A는 B보다 위”는 말이 되지만, “A − B 와 B − C 가 같다”는 보장되지 않는다

3.9.4 세 종류를 가르는 두 개의 질문

질문 숫자형 순서형 범주형
값을 빼면 의미가 있는가?
값에 순서가 있는가?
  • 나이 40 − 24 = 16년 → 뺄 수 있다 → 숫자형
  • 학점 A − B = ? → 뺄 수 없다. 하지만 A > B → 순서형
  • 부서 ‘영업’ − ‘개발’ = ? → 뺄 수도, 순서를 매길 수도 없다 → 범주형

이 구분이 Ch04에서 실제로 쓰인다. 신경망에 넣을 때 범주형은 원-핫 인코딩을 해야 하지만, 순서형은 순서를 살려 숫자로 넣는 편이 나은 경우가 많다 (A=3, B=2, C=1). 순서 정보를 버리지 않기 위해서다.

3.9.5 수치 예시: 변수 유형 비교

코드
import pandas as pd

df = pd.DataFrame({
    '': [1, 2, 3, 4, 5],
    '나이': [24, 23, 40, 50, 27],
    '성별': ['남', '여', '남', '여', '여'],
    '직업': ['군인', '디자이너', '디자이너', '회사원', '요리사'],
    '브랜드': ['삼성', '애플', '애플', '삼성', '삼성'],
})
df.to_html(index=False, border=0)
표 3.6: 숫자형 변수와 범주형 변수 비교
나이 성별 직업 브랜드
1 24 군인 삼성
2 23 디자이너 애플
3 40 디자이너 애플
4 50 회사원 삼성
5 27 요리사 삼성
  • 숫자형 변수: 나이 → 값의 차이(24세 vs 40세)가 의미 있음
  • 범주형 변수: 성별, 직업, 브랜드 → 값 간의 크기 비교 불가

3.10 회귀와 분류

3.10.1 회귀 (Regression)

회귀 (Regression)

종속변수가 숫자형(연속형)인 경우. 실수값을 예측한다.

  • 예: “경력이 8년인 사람의 연봉은 얼마인가?” → 실수값 예측

3.10.2 분류 (Classification)

분류 (Classification)

종속변수가 범주형인 경우. 어느 범주에 속하는지 예측한다.

  • 예: “나이 30, 남성, 엔지니어인 사람이 삼성과 애플 중 어느 핸드폰을 고를까?” → 범주 예측

인터랙티브 — 회귀와 분류의 차이를 직접 확인해 보세요

토글을 바꾸면서 같은 데이터 구조에서 종속변수의 유형에 따라 문제가 어떻게 달라지는지 관찰하세요.


3.11 지도학습 vs 비지도학습

3.11.1 지도학습 (Supervised Learning)

지도학습 (Supervised Learning)
  • 데이터: \((X, y)\)\(X\) 데이터와 \(y\) 레이블(정답)이 모두 존재
  • 목표: \(X \to y\)의 관계를 매핑하는 함수를 찾는 것
  • 예시: 회귀, 분류, CNN, 객체탐지, Sequence 모델

3.11.2 비지도학습 (Unsupervised Learning)

비지도학습 (Unsupervised Learning)
  • 데이터: \(X\)만 존재 — \(y\)(정답)는 존재하지 않음
  • 목표: 데이터를 설명하는 내재적인 구조를 학습
  • 예시: 군집분석(Clustering), 차원축소(Dimensionality Reduction), 이상치 탐지
지도학습 비지도학습
데이터 \((X, y)\) \(X\)
정답 존재 없음
목표 \(X \to y\) 매핑 데이터 내부 구조 발견
예시 회귀, 분류, CNN 군집분석, 차원축소
지도학습

X (입력)
y (정답)

모형
학습

X → ŷ
예측

비지도학습

X (입력)
y 없음

모형
탐색

구조
군집, 패턴


3.12 딥러닝이란?

딥러닝 (Deep Learning)

\(X\)\(y\)의 관계를 다층 퍼셉트론(인공신경망) 구조로 표현하는 모형.

기존의 머신러닝 모형(회귀, SVM, Random Forest 등)과 달리, 인공신경망의 층(layer)을 깊게 쌓아서 복잡한 패턴을 학습한다.


3.13 왜 딥러닝이 각광받는가?

3.13.1 모델링의 자유도

기존의 머신러닝 모형은 주로 정형데이터(Tabular Data)의 회귀/분류에 집중되었다.

딥러닝은 모델링의 자유도가 높아 다양한 종류의 데이터를 표현할 수 있다.

데이터 유형 예시 딥러닝 활용
정형 데이터 테이블, 스프레드시트 회귀, 분류
텍스트 데이터 리뷰, 뉴스, 소셜미디어 자연어 처리 (NLP)
이미지 데이터 사진, 의료영상 이미지 분류, 객체탐지
음성 데이터 음성 명령, 통화녹음 음성 인식
동영상 데이터 CCTV, 스트리밍 행동 인식, 비디오 분석

3.13.2 모델의 유연성

딥러닝은 기존 모형에 비하여 유연성이 높아 복잡한 비선형 관계를 표현할 수 있다.

특히 학습에 사용되는 데이터가 많을수록 딥러닝이 유리하다.

3.13.3 인프라의 성숙

인공신경망의 기반기술은 이미 수십 년 전부터 제시되었다. 데이터 + 하드웨어 + 소프트웨어의 3요소가 결합하여 사용 저변이 확대되었다.

요소 발전 내용
Big Data 대규모 데이터셋 수집·저장이 용이해짐 (ImageNet, Wikipedia 등)
Hardware GPU의 대규모 병렬처리 능력 활용
Software TensorFlow, PyTorch 등 딥러닝 프레임워크 발전

3.13.4 사전학습 생태계

사전학습 모델과 Fine-tuning
  • 사전학습 모델 (Pre-trained Model): 방대한 데이터로 미리 학습된 모형
  • Fine-tuning: 사전학습 모델을 가져와 나의 작업에 맞게 미세조정하는 것

사전에 방대한 데이터를 가지고 학습된 모형을 가져와 재활용할 수 있는 생태계가 존재한다.

Before (사전학습 이전) After (사전학습 이후)
작업마다 모형을 처음부터 학습 사전학습된 모형을 가져와서 미세조정
대량의 데이터와 컴퓨팅 자원 필요 소량의 데이터로도 높은 성능 달성 가능
Task #1, Task #2, … 각각 독립 하나의 기반 모형 → 여러 작업에 응용
사전학습 모델 (Pre-trained) 대규모 데이터로 미리 학습 완료 가져오기 Fine-tuning 나의 소량 데이터로 미세조정 Task 1: 감성분석 Task 2: 번역 Task 3: 요약

3.14 핵심 요약

개념 핵심 내용
고전적 프로그래밍 vs ML 규칙+데이터→답 vs 데이터+답→규칙
AI ⊃ ML ⊃ DL 딥러닝은 인공신경망을 사용하는 머신러닝의 한 분야
데이터 변수(열) × 데이터 포인트(행)의 구조. 크기는 \((n, p)\)
정형 / 비정형 표로 정리됨 / 이미지·텍스트·음성처럼 표가 아님
독립변수/종속변수 \(X\) (입력, 원인) / \(y\) (출력, 결과)
모형 \(X\)\(y\)의 관계에 대한 수학적 표현
파라미터 모형 내에서 관계를 조절하는 매개변수 (데이터가 정함)
하이퍼파라미터 사람이 미리 정하는 값 — 차수, 노드 수, 학습률, 배치 크기
학습 데이터를 가장 잘 설명하는 파라미터를 찾는 과정
변수의 종류 숫자형(빼기 가능) / 순서형(순서만) / 범주형(둘 다 불가)
회귀/분류 \(y\)가 숫자형 → 회귀, \(y\)가 범주형 → 분류
추론 ≠ 인과 모형이 보여주는 것은 연관성. 인과는 실험 설계가 필요
지도/비지도학습 정답 있음 → 지도학습, 정답 없음 → 비지도학습
딥러닝 각광 이유 모델링 자유도, 유연성, 인프라 성숙, 사전학습 생태계