기본 콘텐츠로 건너뛰기

라벨이 확률인 게시물 표시

pandas_ta를 적용한 통계적 인덱스 지표

[data analysis] 정규분포(Normal Distribution)

정규분포(Normal (Gaussian) Distribution) 여러 현상들에 대해 큰 규모의 자료를 조사하면 그림 1과 같이 평균에서 가장 높은 확률을 보이며 그 평균을 중심으로 양쪽으로 같은 정도로 확률 감소를 보이는 종 모양의 형태를 보입니다. 이러한 분포를 정규분포(normal Distribution) 라고 합니다. 특히 큰 규모의 확률변수들에 대한 분포는 그 변수들의 조건에 상관없이 정규분포에 근접하기 때문에 데이터들의 여러 특성들을 연구하는데 중심이 되는 분포입니다. 그림 1. 정규분포에서 확률과 표준편차의 관계. x=np.linspace(-4, 4, 100) p=stats.norm.pdf(x) nme=[r"-2.56$\sigma$", r"-1.96$\sigma$", r"$\sigma$", r'$\mu$', r"$\sigma$", r"1.96$\sigma$", r"2.56$\sigma$"] x1=np.linspace(-1, 1, 100) x21=np.linspace(-1.96, -1, 100) x22=np.linspace(1, 1.96, 100) x31=np.linspace(-2.56, -1.96, 100 ) x32=np.linspace(1.96, 2.56, 100) fig, ax=plt.subplots(figsize=(9,3)) ax.plot(x, p, color="r") ax.fill_between(x1, stats.norm.pdf(x1), color="g", alpha=0.3, label="68%") ax.fill_between(x21, stats.norm.pdf(x21), color="b", alpha=0.3, label="95%") ax.fill_between(x22, stats.norm.pdf(x22), color...

[data analysis] 감마분포(Gamma Distribution)

감마분포(Gamma Distribution) 확률은 전체 경우의 수 중에서 특정 시건의 비율이므로 확률을 계산하는데 있어 전체 경우의 수를 산정하는 것이 중요합니다. 이산변수의 경우 전체 경우의 수는 계승(factorial)을 사용하여 계산합니다. 연속변수의 경우에서 랜덤변수는 셀수 있는 수가 아니므로 계승을 직접적으로 사용할 수 없습니다. 대신에 계승에 대응하는 적분식을 사용하는데 이 부분을 감마함수 (식 1)로 대체할 수 있습니다. 감마함수를 기본으로 하는 감마분포는 지수 분포와 정규분포와 관련된 분포입니다. 감마함수 Γ(x)로 나타내는 감마함수는 양의 정수 영역에서 factorial 함수의 형태를 가지며 식 1과 같이 정의합니다. 이 식의 첫번째는 이산변수, 두번째는 연속변수를 위한 함수입니다. \begin{align}\tag{1} \Gamma(n)&=(n-1)! , \quad\quad n \in \{1,2,3, \cdots \}\\ &=(n-1)\Gamma(n-1)\\ &=\int^n_0 x^{n-1}e^{-x} ,\quad n > 0 \end{align} (식 1) 예 1) n = 10인 이산변수와 연속변수의 factorial과 감마함수를 계산합니다. factorial은 numpy 또는 scipy의 math 모듈의 factorial() 함수로 계산할 수 있으며 위의 감마함수는 scipy.special의 gamma() 함수로 계산할 수 있습니다. 또한 이 계산은 sympy 패키지의 symbol() 함수와 intergrate() 함수를 사용하여 수행할 수 있습니다. import numpy as np import pandas as pd import matplotlib.pyplot as plt from scipy import stats from sympy import * np.math.factorial(10-1) 362880 from scipy import specia...

[data analysis] t 분포(Student's t distribution)

t분포(Student's t distribution) 정규분포 N(μ, σ 2 )을 따르는 모집단으로부터 n개의 샘플들(x 1 , x 2 , ..., x n )을 추출하면 정규화된 샘플들의 제곱의 합은 자유도가 n-1인 χ 2 분포를 따릅니다(식 1). \begin{align}X&=(x_1,\,x_2,\,\cdots,\, x_n)\\S^2&=\frac{1}{n-1}\sum^n_{i=1}(x_i-\bar{x})^2\\ (n-1)S^2 &= \sum^n_{i=1}(x_i - \bar{x})^2\\ \frac{(n-1)S^2}{\sigma^2}&= \sum^n_{i=1}\frac{(x_i - \bar{x})^2}{\sigma^2}\\&=\sum^n_{i=1}z_i^2\\&= z_1^2 +z_2^2+ \cdots +z_n^2 \end{align} (식 1) 식 3.2.43의 마지막 항의 각각 정규화된 값의 제곱은 χ 2 (1)( 카이제곱 분포 참조 )을 따르므로 $\frac{(n-1)S^2}{\sigma^2}$는 χ 2 (n)를 따릅니다. 그러므로 표준정규분포를 따르는 확률변수 Z과 자유도 k(= n)에 대한 카이제곱분포의 비의 결과를 새로운 확률변수 T로 정의할 수 있습니다 (식 2). $$T_k =\frac{Z}{\sqrt{\frac{\chi^2_k}{k}}}$$ (식 2) 식 2에서 Z은 표준정규분포를 따르는 확률변수이고 χ 2 k 는 자유도 k인 카이제곱분포를 따르는 확률변수로 $\frac{(n-1)S^2}{\sigma^2}$을 의미합니다. k는 자유도입니다. 이 결과인 확률변수 T는 자유도가 k인 t 분포를 따릅니다. 식 2에 의해 생성되는 확률변수 T의 분포인 t 분포의 확률밀도 함수(pdf)는 식 3로 정의합니다. \begin{align}f(x,\,k)&=\frac{\Gamma\left(\frac{k+1}{2}\right)}{\sqrt{\pi k}\Gam...

[data analysis] 확률과 주요통계량: 모멘트와 기대값

확률과 주요통계량 내용 모멘트(Moment) 기대값(Expected Value) 기대값의 선형결합 확률과 주요통계량: 모멘트와 기대값 예제 모멘트(Moment) 확률변수와 확률 분포의 특징과 형태를 수학적으로 설명하기 위한 정량적 지표를 모멘트(moment) 라고 하며 식 1과 같이 정의합니다. $$\begin{align}\tag{식 1}&\text{n 차 모멘트}= E(x^n)\\ &n= 1, 2, \cdots \end{align}$$ 식 1에서 E(x)는 확률변수 x에 대한 기대값(평균)을 나타냅니다. 그러므로 모멘트(moment) 는 변형된 확률변수의 기대값을 의미합니다. 이러한 모멘트는 기술 통계에서 소개한 평균 , 분산 과 함께 왜도, 첨도 등 다양한 통계량의 유도에 사용됩니다. 기대값(Expected Value) 평균은 변수들의 특성을 파악하기 위해 가장 많이 사용되는 통계량입니다. 이 통계량은 각 변수값에 대한 확률을 고려하는 것으로 기대값(expected value, E(X)) 이라고 합니다. 확률변수 x에 대응되는 확률은 다른 변수들에 비해 그 변수가 나타날 상대 가능도(relative likelihood) 를 의미합니다. 많은 경우 확률변수와 확률의 관계는 함수로 특정할 수 있으며 그 함수를 확률함수라고 합니다. 확률함수는 변수가 이산형일경우에는 확률질량함수(probability mass function) , 연속형일 경우에는 확률밀도함수(probability density function) 로 구분합니다. 일반적으로 확률밀도(질량)함수는 f(x)로 나타내며 그 함수의 합(적분)인 누적확률함수는 F(x)로 표현합니다. 이 확률밀도(질량) 함수를 사용하여 1차모멘트인 평균은 식 2와 같이 계산할 수 있습니다. $$\tag{식 2}\mu=E(X)=\begin{cases}\sum^N_{i=0} x_iP(X=x_i)&x:\text{이산변수},\; N:\text{샘플 크기...

[data analysis]연속확률분포: 확률밀도 함수(pdf)

연속확률분포 내용 확률밀도함수(Probability Density Function, PDF) 일정구간 [a, b]에서 무작위로 하나의 수를 선택하는 확률이 동일하다면 그 수는 랜덤변수(random variable) 가 됩니다. 그 구간의 수들은 무한하므로 하나의 점을 특정할 수 없습니다. 즉, 연속변수에서 특정한 점에서의 확률은 정의할 수 없습니다. 대신에 전체를 일정구간으로 소그룹화하면 하나의 그룹을 선택할 확률은 전체 구간의 길이에 대해 그 선택된 부분의 길이로 정의할 수 있습니다. 이 관계는 식 1과 같이 나타낼 수 있습니다. \begin{align}P(X ∈ [a, b])&=1\\P(\in [x_1,\,x_2])&=\frac{x_2-x_1}{b-a}\\a\le x_1&\le x_2 \le b \end{align} (식 1) 식 1을 기반으로 확률변수 X에 대한 누적분포함수(CDF)는 식 2와 같이 나타낼 수 있습니다. $$F(X)=\begin{cases}0&\text{for}\; x \le a\\\frac{x-a}{b-a}&\text{for}\; a \le x \le b\\1&\text{for}\; x \ge b \end{cases}$$ (식 2) 사실 연속변수의 경우 한 지점에서의 확률은 정의할 수 없으므로 기호 "≤" 와 "<"의 차이 역시 정의 할 수 없습니다. [연속확률함수의 조건] 식 3의 관계가 성립하기 위해서는 함수 f(x)가 모든 x에서 대응하는 값을 정의할 수 있는 연속함수(continuous function)이어야 합니다. F(x) = P(X ≤ x) (식 3) 다시말하면 누적분포함수인 F(x)는 모든 범위에서 미분가능한 함수이어야 합니다. 확률밀도함수(Probability Density Function, PDF) 이산확률함수에 각 경우의 확률은 확률질량함수(PMF)와 누적분포함수(CDF)...

[data analysis] 포아송분포(Poisson distribution)

포아송분포(Poisson distribution) 고정된 시간이나 공간에서 일어날 수 있는 사건의 확률을 표현하는 이산분포이며 가장 많이 사용되는 분포 중의 하나로서 확률변수 X는 사건의 수가 됩니다. 그러므로 이 분포는 전체 발생 사건수를 결정할 수 없으므로 전체에 대한 대상 사건의 발생의 비율 즉, 일반적인 확률 개념을 사용할 수 없습니다. 대신에 대상 시간 또는 공간에서의 평균적인 발생횟수를 알 수 있다면 식 1과 같은 분포함수를 적용할 수 있습니다. $$P(X = x) = \frac{e^{-\lambda}\lambda^x}{x!}$$ (식 1) 식 1에서 λ는 사건의 평균발생수를 나타냅니다. 위 식의 확률질량함수를 가지는 포아송 분포는 다음의 전제조건을 갖습니다. 특정한 시간 또는 공간에서 발생하는 사건은 다른 시간, 공간에서 발생하는 결과와 독립이어야 합니다. 단위 시간 또는 공간에 발생하는 사건의 횟수는 동일하여야 합니다. 매우 짧은 시간 또는 매우 작은 공간에서 두 개 이상의 결과가 동시에 발생할 확률은 0이어야 합니다. 모든 범위에서 포아송분포의 확률질량함수는 1이 되어야 하며 식 2와 같이 증명할 수 있습니다. \begin{align}\sum^\infty_{i=1}\frac{e^{-\lambda}\lambda^i}{i!}&=e^{\lambda}\sum^\infty_{i=1}\frac{\lambda^i}{i!}\\&=e^{-\lambda}e^\lambda\\&=1\\ \because\, \sum^\infty_{x=1}\frac{\lambda^x}{x!}&=1+\lambda+\frac{\lambda^2}{2!}+\frac{\lambda^3}{3!}+\cdots\\&\text{Taylor series}\end{align} (식 2) 위 전개과정에서 적용한 테일러 급수 를 sympy의 series() 와 Sum() 함수를 사용하여 확인해 봅니다. l, x = symbols(...

[data analysis] 기하분포(Geometric distribution)

기하분포(Geometric distribution) 결과가 성공과 실패인 베르누이 시행 을 반복하여 첫번째로 성공이 나올때까지의 확률변화의 분포를 기하분포 (Geometric distribution) 라고 합니다. 예를 들어 성공확률이 p인 베르누이 시행을 반복시행하여 최초 성공(s)이 되는 경우를 확률변수 X로 하는 확률질량함수는 식 1과 같이 될 것입니다. S x = {1, 2, · · · } (식 1) f(1) = P(X = 1) = p f(2) = P(X = 2) = (1 − p)p ⋮ 위의 결과를 일반화하면 기하분포의 확률질량함수는 식 2와 같이 공식화 할 수 있습니다. f(x) = P(X = x) = (1 − p) x−1 p (식 2) 식 2와 같이 확률질량함수는 매개변수 p에만 의존하므로 기하분포는 식 3으로 표시하며 유일한 매개변수에 의한 기하분포의 변화는 그림 1에서 확인할 수 있습니다. X ∼ Geometric(p) (식 3) 그림 1 모수에 따른 기하분포의 변화. fig, ax=plt.subplots(figsize=(4,3)) p=[p1,p2,p3,p4] col=['g','b','r','k'] nme=[0.1, 0.3, 0.5, 0.7] for i in range(len(p)): ax.plot(x, p[i], color=col[i], label=f"Geometric({nme[i]})") ax.set_xlabel("x") ax.set_ylabel("Probability") ax.legend(loc="best") plt.show() X ∼ Geometric(p) 분포의 기대값과 분산을 모멘트생성함수(MGF)로부터 유도해 봅니다. 식 4는 기하분포의 MGF 입니다. \begin{align}M_x(t)&=E(e^{tX})\\ &=\sum^\infty_...

[data analysis] 베이즈정리 (Bayes theorem)

베이즈정리 (Bayes theorem) 관련된 내용 확률(probability) 독립사건(independent event) 조건부확률(conditional probability) 예 1) 표 1은 사무실 lamp을 생산하는 공장 A, B, C의 생산율과 불량품율에 대한 자료입니다. 표 1 공장별 생산에 대한 자료 공장 Product D, P(D|Product) A 0.35 0.015 B 0.35 0.01 C 0.3 0.02 Product: 생산율, D: 불량률 생산된 불량품이 각 공장에서 생산되었을 확률? 공장 C에서 생산되었을 확률은 식1과 같이 나타낼 수 있습니다. $$P(C\,|\, D) = \frac{P(C\, ∩\, D)}{P(D)}$$ (식 1) 표 1에서 공장 C에서의 불량품율에 대한 정보를 사용할 수 있습니다. 즉, P(D|C)은 식 2와 같이 계산할 수 있습니다. $$ P(D\, |\, C) = \frac{P(D\, ∩ \,C)}{P(C)}$$ (식 2) 교집합은 교환법칙이 성립하므로 P(D ∩ C) = P(C ∩ D)로 치환할 수 있습니다(식 3). \begin{align} P(C \,∩\, D)& = P(D\,|\,C)P(C)\\&= 0.020·0.3\\&=0.006\end{align} (식 3) P(D)는 각 공장에서의 불량품 확률의 합과 같습니다(식 4). \begin{align}P(D)&= P(D\,∩\,A) + P(D\,∩\,B) + P(D\,∩\,C)\\ &= P(D\,|\,A)P(A) + P(D\,|\,B)P(B) +P(D\,|\,C)P(C)\\ &= 0.015·0.35 + 0.01·0.35 + 0.02·0.30\\ &= 0.01475\end{align} (식 4) A=np.array([0.35, 0.015]) B=np.array([0.35, 0.01])...

[data analysis] 이항정리와 큰수의 법칙

이항정리와 큰수의 법칙 조합(combination) 은 미지수들로 구성된 다항식의 계수를 결정하기 위해 적용됩니다. 예를 들어 (a + b) 2 의 경우를 전개하면 a 2 + 2ab + b 2 이 됩니다. 이 전개된 식의 각 계수들은 표 1과 같이 두 항 a, b중에 b를 0번, 1번, 그리고 2번 선택하는 경우의 수와 같습니다. 표 1 (a + b) 2 의 각 계수에 대한 조합표현 선택 횟수 결과 표현 0 2 C 0 = 1 a 2 1 2 C 1 = 2 2ab 2 2 C 2 =1 b 2 표 1과 같이 이항식을 전개하는 과정에 조합을 적용하는 것을 이항정리 라고 하며 식 1과 같이 일반화합니다. [이항정리(Binomial Theory)] 순서를 고려하지 않고 n개 중에서 서로 다른 k개를 선택하는 경우로 식 1과 같이 계산되며 이 정의를 이항정리라고 합니다. $$(x+y)^n=\sum^n_{k=0} \binom{n}{k}x^{n-k}y^k$$ (식 1) 예를 들어 위 식을 사용하여 (x + y) 3 에서 x 2 y의 계수는 다음과 같이 결정할 수 있습니다. special.comb(3,1) 3.0 예 1) 학생 20명을 정원이 6, 4, 5, 5 명인 방 4개를 배정할 수 있는 경우의 수는 결정합니다. 순서를 고려하지 않고 선택하는 경우로 조합입니다. 식 2과 같이 선택할 모집단과 샘플의 크기가 고려하여 계산합니다. \begin{align}&\binom{20}{6}\binom{14}{4}\binom{10}{5}\binom{5}{5}\\&=\frac{20!}{6!4!}\frac{14!}{4!10!}\frac{10!}{5!5!}\frac{5!}{5!0!}\\&=\frac{20!}{6!4!5!5!}\\&=\binom{20}{6\, 4\, 5\, 5}\end{align} (식 2) num=[6, ...

[data analysis]균일분포(Uniform Distribution)

균일분포(Uniform Distribution) 식 1은 구간 [a, b]에서 확률 변수 x는 일정한 확률밀도함수를 가지는 분포를 나타내는 것으로 균일분포라고 합니다. X ~ Uniform(a, b) (식 1) $$f(x)=\begin{cases}\frac{1}{b-a}&a\le x \le b\\ 0& \text{otherwise} \end{cases}$$ 예 1) 변수 X가 [0,10]의 범위에서 균일 분포를 이룬다면 다음 확률을 결정합니다. $$f(x) = \frac{1}{10-0}$$ p(2 < x < 9) p(1 < x < 4) p(x > 6) 이 균일분포의 확률밀도함수는 다음과 같습니다. a, b, x=symbols("a b x") f=Rational(1, 10) f $\frac{1}{10}$ 1) p(2 < x < 9) F1=f.integrate((x, 2, 9)) F1 $\frac{7}{10}$ 2) p(1 < x < 4) F1=f.integrate((x, 1, 4)) F1 $\frac{3}{10}$ 3) p(x > 6) F1=f.integrate((x, 6, 10)) F1 $\frac{2}{5}$ 예 2) 버스가 7시에 출발하여 특정 정거장에 정확히 15분 마다 정차한다고 가정합니다. 만약 승객이 7시와 7:30분 사이에 버스를 기다리는 경우 기다리는 시간에 대한 다음 확률을 결정합니다. 5분 미만 최소 12분 확률변수 X를 [0, 30] 사이의 분(minute)이라고 한다면 각 분에 승객이 정류장에 있을 확률은 1 / 30 으로 일정하므로 확률밀도함수 f(x) = 1 / 30 인 균일 분포를 따른다고 할 수 있습니다. P(X < 5분)의 경우 승객이 7시 10분 ~ 15분, 25분 ~ 30분 사이에 정류장에 있을 확률입니다. 즉, P(10 < x < 15) + P(2...

[data analysis] 초기하분포(Hypergeometric distribution)

초기하분포(Hypergeometric distribution) 초기하분포(Hypergeometric distribution) 란 N개 중에 n번 비복원 추출하는 경우 x번 성공확률의 분포이다. 예를 들어 5개의 파란공과 3개의 빨간공이 포함되어 있는 주머니에서 2개의 공을 선택하면 그 공이 모두 파란 공일 확률은식 1과 같이 계산할 수 있습니다. $$\frac{\binom{5}{0} \binom{3}{2}}{\binom{8}{2}}$$ (식 1) p=special.comb(5,0)*special.comb(3,2)/special.comb(8, 2) round(p, 3) 0.107 이 시행은 모집단에서 선택할 공의 수에 대한 조건과 최종 성공을 위한 조건을 만족하여야 합니다. 즉, 두 가지 조건에 따른 시행은 선택된 파란공의 수가 랜덤변수(X)로 하면 표본공간은 S x = {0, 1, 2}로 정의할 수 있습니다. 각 변수에 대응하는 확률의 변화는 초기하분포에 부합하며 식 2와 같이 나타냅니다. X ∼ hypergeom(N, m, n) (식 2) N : 모집단 수 m : 성공경우의 총수 n : 총 시행횟수 식 1에서 확률변수 x의 변화에 의해 생성되는 초기하 분포는 hypergeom(8, 3, 2)으로 나타낼 수 있습니다. 이 식을 확률변수 x에 대해 일반화한 초기하분포의 확률질량함수는 식 3과 같이 정의됩니다. \begin{align}f(x) &= P(X=x)\\&=\frac{\binom{m}{x} \binom{N-m}{n-x}}{\binom{N}{n}} \end{align} (식 3) 초기하분포의 통계량들은 scipy.stats 모듈의 hypergeom() 클래스로 계산할 수 있습니다. x=2; M=8; n=3; N=2 round(stats.hypergeom.pmf(x, M, n, N),3) 0.107 확률변수 x에 대해 PMF를 계산하면 다음과 같습니다. p=stats.hypergeom.pmf(...

[data analysis] 음이항분포(Negative Binomial Distribution)

음이항분포(Negative Binomial Distribution) 음이항 분포는 베르누이 시행을 반복하면서 r번째 성공까지의 확률의 변화를 나타내는 분포이며 파스칼 분포 (Pascal distribution) 라고도 합니다. 예를 들어 동전의 앞면이 r회가 될 때까지 동전던지는 시행을 계속하는 경우로서 동전던지는 총 횟수가 확률변수 x가 됩니다. 이 확률변수는 동전 던지기 1회 당 앞면이 나오는 확률(p)가 앞면의 수(r)에 의존합니다. 이를 일반화하면 식 1과 같이 음이항분포의 확률변수는 성공횟수(r)와 베르누이 확률(p)을 매개변수로하는 확률분포로 나타낼 수 있습니다. X ~ NB(r, p) (식 1) 음이항 분포에서 최종 시행은 성공으로 시행이 종료되므로 식 2와 같이 마지막 시행을 제외한 경우에서 r - 1 횟수를 선택하는 이항확률로 간주할 수 있습니다(r은 성공횟수). \begin{align} f(x) &= P(X = x)\\&=\binom{x-1}{r-1}p^r(1-p)^{x-r}\\ x&=r, r+1, \cdots \end{align} (식 2) 식 2에서 성공횟수 r = 1인 경우는 기하분포가 됩니다. 예 1) 동전 던지기에서 4번 앞면이 발생하고 그 총 횟수가 10회가 되는 사건 A의 확률을 계산합니다. 사건 A의 확률은 식 3.1.32와 같이 나타낼 수 있습니다. A = {X = 10}, 10번 시행에 4번 앞면 (식 3.1.32) B = {X = 9}, 9번 시행에 3번 앞면 C = {X = 1}, 마지막 1번 시행이 앞면   P(A) = P(B ∩ C) 위 과정에서 P(C) = p(단일 시행에서 성공확률)가 되며 P(B)는 이항분포가 되므로 식 3과 같이 나타낼 수 있습니다. $$P(B) = \binom{9}{3}p^3(1-p)^6$$ (식 3) 결국 A의 확률질량함수는 식 3에서 나타낸 함수에 최후의 성공확률을 고려한 것으로 식 4와 같이 계산됩니다. \be...

[data analysis] 베르누이와 이항확률분포

베르누이분포(Bernoulli distribution)와 이항확률 분포 내용 베르누이분포(Bernoulli distribution) 이항확률분포(Binomial distribution) 베르누이분포(Bernoulli distribution) 한번의 시행에서 성공 또는 실패(1또는 0)의 결과만을 보이는 확률분포를 베르누이분포(Bernoulli distribution) 라고 합니다. 확률변수는 두개의 값만을 포함합니다. 확률변수는 두개의 값만을 포함하며 확률질량함수는 식 1과 같이 나타낼 수 있습니다. \begin{align}f(x)& = P(X=x)\\ &=\begin{cases}p&\quad \text{for}\; x=1\\1-p&\quad \text{for}\; x=0\end{cases}\end{align} (식 1) 위 확률질량함수(PMF)는 하나의 매개변수(parameter) 즉, 확률 p에 의해 결정됩니다. 그러므로 이 분포는 식 2와 같이 나타냅니다. X ~ Bernoulli(P) (식 2) import numpy as np import pandas as pd from scipy import stats from sympy import * import matplotlib.pyplot as plt 예 1) 1개의 주사위를 시행하는 경우 확률변수는 다음과 같습니다. 표 주사위 시행에서의 확률변수 주사위 눈 x 1 or 3 1 other 0 이 분포의 확률질량함수(PMF)와 E(x)? 확률함수와 기대값은 식 3과 같이 계산할 수 있습니다. \begin{align}f(x)&=\left(\frac{1}{3}\right)^x \left(\frac{2}{3}\right)^{1-x}\\ E(x)&=1\cdot \frac{1}{3}+0\cdot \frac{2}{3}\end{align} (식 3) ...

[data analysis]이산확률분포: 확률질량함수(pmf)와 누적분포함수 (cdf)

이산확률분포 내용 확률질량함수(PMF) 누적분포함수(Cumulative Distribution Function, CDF) 확률분포는 샘플공간의 각 값과 그에 대응하는 확률로 구현됩니다. 즉, 변수의 값들과 확률 사이의 관계를 함수로 표현할 수 있습니다. 그 변수가 이산변수(discrete variable) 일 경우 각 값에 대응하는 확률은 대상이 되는 값들의 빈도를 비율로 나타냅니다. 이 경우 한 지점에 대응하는 확률을 표현할 수 있으며 확률질량함수 (Probability Mass Function, PMF) 라고 합니다. 그러나 연속변수(continuous variable) 의 경우 한 지점에 대응하는 확률을 계산할 수 없습니다. 대신에 일정한 구간에 대응하는 확률은 계산될 수 있습니다. 즉, 전체에 대해 일정한 구간의 밀도로 확률을 표현합니다. 이 경우의 확률함수를 확률밀도함수 (Probability Density Function, PDF) 라고 합니다. 두 경우 모두 일정한 변수구간에서의 각 확률의 합을 확률누적분포함수 (Cumulative Distribution Function, CDF) 라고 합니다. 확률함수는 변수에 대응하는 확률의 집중, 퍼짐등의 정보를 포함합니다. 이러한 정보에 따라 나타나는 특징적인 형태를 확률분포(probability distribution)라고 합니다. 데이터의 수가 증가할수록 분포는 특정한 형태로 수렴합니다. 그 특정한 분포의 형태는 몇 가지의 확률질량함수 또는 확률밀도함수로 나타낼 수 있습니다. 이러한 분포와 함수들은 여러 통계 분석의 근거를 제공합니다. 확률질량함수(PMF) 표본공간(S)의 각 사건(x)에 대응하는 확률(p)을 함수로 나타낼 수 있습니다. 즉, 확률은 사건에 의존하는 함수로 p(x) = f(x)의 형태로 나타낼 수 있습니다(식 1). S = {x 1 , x 2 , x 3 , …} (식 1) f(x i ) = P(X = x i ),   i = 1, 2, 3, … 표본공간이 이산변...