콘텐츠로 이동

확률/통계

1. 확률 기본 법칙

기본 개념

용어 설명
표본 공간(S) 모든 가능한 결과의 집합
사건(Event) 표본 공간의 부분집합
확률 P(A) 0 ≤ P(A) ≤ 1

확률 법칙

덧셈 법칙: P(A ∪ B) = P(A) + P(B) - P(A ∩ B)
독립 사건: P(A ∩ B) = P(A) × P(B)
여사건:    P(Aᶜ) = 1 - P(A)

순열과 조합

구분 공식 설명
순열(P) nPr = n! / (n-r)! 순서 있음
조합(C) nCr = n! / (r! × (n-r)!) 순서 없음
예) 5명 중 3명을 선택할 때
순열: 5P3 = 5×4×3 = 60 (순서 고려)
조합: 5C3 = 10 (순서 무관)

2. 조건부 확률 / 베이즈 정리

조건부 확률

사건 B가 발생했다는 조건 하에 A가 발생할 확률입니다.

P(A|B) = P(A ∩ B) / P(B)

베이즈 정리 (Bayes' Theorem)

사전 확률을 새로운 증거로 갱신합니다.

P(A|B) = P(B|A) × P(A) / P(B)
용어 설명
P(A) 사전 확률 (Prior)
P(A|B) 사후 확률 (Posterior)
P(B|A) 우도 (Likelihood)
P(B) 증거 (Evidence)

활용 예시

스팸 필터, 의료 진단, 머신러닝 분류기


3. 기댓값 / 분산 / 표준편차

기댓값 (Expected Value)

확률 변수의 평균적인 값입니다.

이산 확률 변수: E(X) = Σ x × P(X=x)
연속 확률 변수: E(X) = ∫ x × f(x) dx

분산 (Variance)

데이터가 평균에서 얼마나 퍼져 있는지를 나타냅니다.

Var(X) = E[(X - μ)²] = E(X²) - [E(X)]²

표준편차 (Standard Deviation)

분산의 제곱근으로, 분산과 같은 단위를 가집니다.

σ = √Var(X)

유용한 공식

E(aX + b) = aE(X) + b
Var(aX + b) = a²Var(X)

4. 확률 분포

이항 분포 (Binomial Distribution)

n번의 독립 시행에서 성공 확률이 p일 때, k번 성공할 확률입니다.

P(X=k) = nCk × pᵏ × (1-p)ⁿ⁻ᵏ

기댓값: E(X) = np
분산:   Var(X) = np(1-p)

예) 동전 10번 던져 앞면이 3번 나올 확률: X ~ B(10, 0.5)

정규 분포 (Normal Distribution)

평균 μ, 분산 σ²인 종 모양의 연속 분포입니다.

X ~ N(μ, σ²)

표준 정규 분포

평균 0, 분산 1인 정규 분포입니다.

Z = (X - μ) / σ  →  Z ~ N(0, 1)

68-95-99.7 법칙

μ ± 1σ 범위 안에 약 68% 데이터
μ ± 2σ 범위 안에 약 95% 데이터
μ ± 3σ 범위 안에 약 99.7% 데이터

포아송 분포 (Poisson Distribution)

단위 시간/공간에서 드물게 발생하는 사건 수를 모델링합니다.

P(X=k) = (λᵏ × e⁻λ) / k!

기댓값: E(X) = λ
분산:   Var(X) = λ

예) 1시간에 평균 3건의 고객 문의 → X ~ Poisson(3)


5. 기초 통계

대표값

구분 설명
평균(Mean) 모든 값의 합 / 개수
중앙값(Median) 정렬 후 가운데 값
최빈값(Mode) 가장 많이 나타나는 값

상관관계

상관계수(r) 의미
r = 1 완전 양의 상관
0 < r < 1 양의 상관
r = 0 상관 없음
-1 < r < 0 음의 상관
r = -1 완전 음의 상관

상관관계 ≠ 인과관계: 상관이 있다고 해서 원인-결과 관계가 성립하는 것은 아님


시험 포인트

  • 덧셈 법칙: P(A∪B) = P(A) + P(B) - P(A∩B)
  • 조건부 확률: P(A|B) = P(A∩B) / P(B)
  • 베이즈 정리: 사전 확률 → 증거 반영 → 사후 확률
  • 이항 분포: E(X)=np, Var(X)=np(1-p)
  • 정규 분포: 68-95-99.7 법칙
  • 표준화: Z = (X-μ)/σ
  • 분산 공식: Var(aX+b) = a²Var(X)