기본 콘텐츠로 건너뛰기

라벨이 stats인 게시물 표시

pandas_ta를 적용한 통계적 인덱스 지표

[data analysis] 사후분석(Post-hoc test)

사후분석(Post-hoc test) 관련된 내용 분산분석의 개요 일원분산분석(one-way ANOVA) 사후분석(Post-hoc test) 이원분산분석(two-way ANOVA) 통계 분석은 데이터의 정규성, 등분산성, 그리고 독립성등의 기본가정의 충족 여부에 결과의 합리성을 확보할 수 있습니다. 또한 분산분석의 경우 다중 그룹의 비교이므로 각 그룹간의 효과를 분석할 필요가 존재합니다. 이러한 분석은 분산분석 모형 구축과는 별도로 진행하므로 사후분석이라 합니다. 사후분석에서 가정의 적합성을 검정하기 위해 적용할 수 있는 방법이나 함수는 다음과 같습니다. 정규성 : 반응변수는 정규분포를 따릅니다. scipy.stats.probplot(data) stats.shapiro() , scipy.stats.ansderson(x, dist="norm") 이상치 검정: IQR을 기준으로 판단 할 수 있음 등분산성 scipy.stats.bartlett(smaples..) , scipy.stats.levene() 정규성 분석 결과에 대한 신뢰는 데이터가 통계적 테스트의 기본 가정을 만족시키는 정도에 달려 있습니다. 일원 분산 분석에서 각 그룹의 모집단은 정규 분포를 따르고 동일한 분산을 가정합니다. 그러나 모집단의 정규성을 검정하는 것은 어려울 수 있습니다. 대신에 모델에 의한 잔차의 정규성 검정으로 대신합니다. Q-Q 플롯을 사용하여 정규성 가정을 시각적으로 평가할 수 있습니다. 예1) 일정기간의 코스피(kos), 코스탁(kq), 다우존스 주가지수(dj) 그리고 원-달러(WonDol)의 일일 변화량에 대한 분산분석에 대한 사후분석을 진행합니다. 다음의 코드에 의해 호출할 수 있으며 각 자료의 Open과 Close 사이의 일일 변화율을 계산한 자료를 독립변수와 의존변수( 일원 분산분석을 위한 자료구조 참조 )로 구분합니다. st=pd.Timestamp(2024,1, 1) et=pd.Timestamp...

[data analysis] Breusch-Pegan 검정

Breusch-Pegan 검정 Breusch-Pegan 검정은 회귀모델에서 발생하는 잔차의 이분산성을 검정합니다. 귀무가설과 대립가설은 다음과 같습니다. ( 회귀분석 에 대한 지식이 필요합니다. ) H0: 등분산입니다.(Homoscedasticity) H1: 이분산이 존재합니다.(Heteroscedasiticity) 이 방법은 다음 과정으로 실현됩니다. 회귀모델 생성 모델의 잔차 제곱을 계산 반응변수로서 잔차 제곱을 사용하여 새로운 회귀모델을 생성 nR 2 new 를 통계량으로 χ 2 검정 실시(자유도는 설명변수의 수) n: 데이터 크기, R 2 new : 잔차 제곱을 반응변수로 설정한 회귀모델의 결정계수 이 검정은 statsmodels.stats.diagnostic.het_breuschpagan(잔차, 설명변수) 함수를 사용합니다. 이 함수는 라그랑쥬 승수 통계량(Lagrange multiplier statistic)과 p-value, f-통계량과 p-value를 반환합니다. ( 회귀분석 참조 )

[data analysis] Levene Test

Levene Test 관련된 내용 Bartlett 검정 Fligner 검정 Levene Test Breusch-Pegan 검정 Levene 테스트는 k 샘플(그룹)들의 등분산성을 검정하기 위해 사용합니다. 일부 통계 테스트(예: 분산 분석)에서는 분산이 그룹 또는 샘플 간에 동일하다고 가정하며 회귀분석에서는 다양한 회귀모델들로 계산되는 오차 분포의 분산이 동일하다고 가정합니다. Levene 테스트를 사용하여 이러한 가정을 확인할 수 있습니다. Levene 검정은 Bartlett 검정의 대안으로 자료의 정규성이 불확실한 경우 선호됩니다. 그러나 데이터가 실제로 정규 분포 또는 거의 정규 분포에서 나왔다는 강력한 증거가 있다면 Bartlett의 검정이 더 나은 성능을 보입니다. Levene 검정의 귀무가설과 대립가설은 일반적으로 다음과 같이 기술할 수 있습니다. H0: σ 1 = σ 2 = … = σ k H1: 최소한 한 그룹의 분산이 다름 Levene 검정 통계량(W)은 식 1와 같이 정의됩니다. \begin{align} W&=\frac{N-k}{k-1}\frac{\sum^k_{i=1}n_i(Z_{i.}-Z_{..})^2}{\sum^k_{i=1}\sum^{n_i}_{j=1}(Z_{ij}-Z_{i.})^2}\\ Z_i & =\frac{1}{n_i}\sum^{n_i}_{j=1}Z_{ij}\\ Z_{..} & =\frac{1}{N}\sum^k_{i=1}\sum^{n_i}_{j=1}Z_{ij}\\ & k: \,\text{그룹의 수} \\ & n_i: \,\text{i번째 그룹에 속하는 샘플의 수} \\ & N: \,\text{총 샘플 수} \\ & Z_{ij}:\, \text{i번째 그룹의 j번째 관측값}\, y_{ij}\text{과}\, \hat{y_i}\text{의} L_1 \text{norm입니다.}\end{align} (식 1) Z ij 는 식 2와 같이 계...

[data analysis] Fligner 검정

Fligner 검정 관련된 내용 Bartlett 검정 Fligner 검정 Levene Test Breusch-Pegan 검정 데이터의 정규성을 파악할 수 없는 경우 비모수 방법인 Fligner 검정으로 등분산성을 검정할 수 있습니다. Fligner-Killeen 중앙값 검정은 정규성에서 벗어나는 자료들에 대해 분산의 동질성에 대한 검정입니다(Conover et al.(1981), [CON1]). 즉, 데이터의 순위를 이용하여 검정하는 것으로 검정통계량은 식 1과 같이 정의됩니다. \begin{align}FK &= \frac{\sum^k_{j=1} n_j(\bar{a_j}-\bar{a})}{s^2} \\& k: \,\text{비교할 그룹(변수)의 수} \\& \bar{a_j} : \,\text{j 그룹의 표준점수의 평균} \\& \bar{a}: \,\text{모든 표준점수의 평균} \\& s^2: \,\text{모든 표준점수의 분산} \end{align} (식 1) 식 1의 FK 검정통계량은 자유도 k-1의 χ 2 분포를 따릅니다. 즉, 표준정규분포에 부합하는 각 변수들의 제곱에 대한 분포를 따른다면 분산은 같습니다. 그러므로 이 분석의 귀무가설과 대립가설은 다음과 같습니다. 귀무가설(H0): 집단들의 분산이 같다. 대립가설(Ha): 최소한 두 집단간의 분산이 다르다. stats.fligner() 함수를 사용합니다. 예 1) 일정기간의 코스피지수, 코스탁지수, 다우존스지수, 원-달러 환율의 일일 종가의 변화율 자료들의 Fligner 등분산성 검정을 실시합니다. kos kq dj WonDol 1 0.016 0.008 0.006 0.002 2 -0.007 -0.004 0.014 -0.000 3 0.021 0.008 0.007 0.000 4 0.040 -0.001 0.002 0.006 5 -0.001 -0.01...

[data analysis] Bartlett 검정

Bartlett 검정 관련된 내용 Bartlett 검정 Fligner 검정 Levene Test Breusch-Pegan 검정 Bartlett 검정은 집단(표본)간 분산에 대해 등분산성을 검정합니다. 이 검정은 두 집단 이상의 자료형식에서도 적용할 수 있으므로 t-검정 또는 일원분산분석 에 적용할 자료의 등분산성 가정을 위한 검정에 사용합니다. 이 검정은 정규분포에 부합하는 k개의 그룹에 대한 자유도 k-1인 카이자승(χ 2 ) 분포를 기반으로 합니다. 결정기준인 검정 통계량은 식 1과 같이 계산됩니다. χ 2 분포를 기반으로 하기 때문에 표본이 정규분포를 따르는 것을 전제조건으로 합니다. 만약 표본이 비정규 분포에서 추출된 표본의 경우 이 검정은 단순히 분포의 비정규성을 검정하는 것일 수 있습니다. \begin{align}T&=\frac{(N-k)\ln(s^2_p)-\sum^k_{i=1}(N_i-1)\ln(s^2_i)}{1+\frac{1}{3(k-1)}\left(\left(\sum^k_{i=1}\frac{1}{n_i-1}\right)-\frac{1}{N-k} \right)}\\& s^2_i:\, \text{i 레벨(그룹)의 분산}\\& N: \,\text{자료의 크기} \\& k: \,\text{레벨(집단)의 수} \\& s^2_p: \,\text{합동분산(pooled variance)} \end{align} (식 1) 합동표준편차(pooled standard deviation) 참조 $$s^2_p=\sum^k_{i=1} \frac{N_i-1}{N-k}s^2_i$$ (식 2) 검정의 가설은 다음과 같습니다. 귀무가설(H0): 집단들의 분산이 같다. 대립가설(Ha): 최소한 두 집단간의 분산이 다르다. Bartlett 검정은 scipy.stats.bartlett(smaples...) 함수를 사용할 수 있습니다. 이 함수는 통계량과 유의확률(p-value)를...

[data analysis] Jarque-Bera Test

Jarque-Bera Test 관련된 내용 Q-Q plot shapiro-Wilk test Kolmogorov-Smirnov Test Anderson-Darling 검정 Jarque-Bera test 정규분포는 모수 μ, σ에 상관없이 분포의 형태적인 특성을 가집니다( 확률과 주요통계량: 왜도(skewness)와 첨도(kurtosis) 참조 ). 왜도(skewness, 3차 모멘트)는 pdf의 대칭정도를 나타내는 지표로 표준정규분포의 왜도는 0. 첨도(kuitosis, 4차 모멘트)는 평균 주위에 데이터의 밀집정도를 나타내는 것으로 표준정규분포의 첨도는 3. Jarque-Bera(JB) 검정은 왜도와 첨도를 사용하여 정규성을 추정합니다. 그러므로 왜도와 첨도에 민감한 시계열 데이터나 회귀모델로 생성되는 오차 분석에 주로 적용됩니다. 또한 이 검정은 기준이되는 분포와의 비교가 아니므로 표준화등의 조정이 없는 원시데이터를 직접 적용합니다. 이 검정의 귀무가설(H0)과 대립가설(H1)은 다음과 같습니다. H0: 정규분포를 따릅니다. H1: 정규분포를 따르지 않습니다. 이 검정의 검정통계량은 식 1과 같이 계산됩니다. \begin{align}\text{jb}&=n\left(\frac{S^2}{6}+\frac{(K-3)^2}{24} \right)\\ & S:\, \text{왜도},\; K:\, \text{첨도}\end{align} (식 1) 이 검정통계량은 자유도 2인 χ 2 분포를 따릅니다. 그러므로 이 분포에 적용하여 계산된 검정통계량에 대응하는 p-value를 결정할 수 있습니다. 정규분포의 경우 S=0, K=3 ⇒ JB 통계량은 0입니다. 이 검정은 statsmodels.stats.stattools.jarque_bera() 또는 scipy.stats.jarque_bera() 함수를 사용합니다. 첫번째 함수의 경우는 통계량과 p-value, 왜도와 첨도를 반환하지만 두번째 함수...

[data analysis]Anderson-Darling(AD) 검정

Anderson-Darling(AD) 검정 관련된 내용 Q-Q plot shapiro-Wilk test Kolmogorov-Smirnov Test Anderson-Darling 검정 Jarque-Bera test KS 검정은 표본의 분포와 특정분포를 비교하여 표본의 분포를 결정하기 위해 실시합니다. Anderson-Darling(AD) 검정은 KS 검정을 수정한 것으로 꼬리 부분에 더 많은 가중치를 부여합니다. 또한 KS 검정의 검정량 D는 비교하는 두 분포의 거리차로 특정한 분포를 가정하지 않습니다. 반면이 AD 검정은 임계값을 계산할 떄 정규, 균일, 지수등의 특정분포를 사용합니다. 그러므로 민감한 검정이 가능합니다. 각 분포에 대한 임계값 D를 계산하는 것이 가능하지만 일반적으로 다양한 통계 프로그램에서 제공됩니다.이 검정은 scipy.stats.ansderson(x, dist="norm") 함수에 의한 결과로 판단할 수 있습니다. Anderson-Daring(AD) 검정의 귀무가설과 통계량을 식 1과 같습니다. H0: 데이터는 특정 분포를 따릅니다. (식 1) 검정 통계량 A 2 = -N − S $$S=\sum^N_{i=1}\frac{2i-1}{N}\left[\ln F(y_i) + \ln(1-F(y_{N+1-i})\right]$$ 식 1에서 F(y)는 특정분포의 누적분포 함수이고 y i 는 정렬된 데이터(ordered data)입니다. 예 1) 다음은 일정한 기간의 kospi 지수와 kosdaq 지수의 일일 종가 자료입니다. kospi kosdaq 0 2669.8 878.9 1 2607.3 871.6 2 2587.0 866.2 ...

[data analysis]Kolmogorov-Smirnov Test

Kolmogorov-Smirnov Test 관련된 내용 Q-Q plot shapiro-Wilk test Kolmogorov-Smirnov Test Anderson-Darling 검정 Jarque-Bera test Kolmogorov-Smirnov 검정 (K-S test)은 표본이 특정 분포를 가진 모집단에서 추출되었는지 결정하는 데 사용됩니다. 즉, 자료의 분포가 특정한 분포와의 일치정도를 정량화하여 검정하는 방법입니다. 분석대상 자료의 분포를 알 수 없으므로 식 1에 의해 생성된 경험적 분포 함수 (Emperical distribution fucntion, ECDF) 와 특정분포를 비교합니다. $$ECDF =\frac{n(i)}{N}$$ (식 1) 식 1의 n(i)는 데이터를 오름차순으로 정렬한 경우의 각 요소의 위치이며 분모인 N은 전체 자료수입니다. 자료가 오름차순으로 정렬되면 각 값까지의 누적확률은 그것이 위치하는 순서에 의존됩니다. 예를 들어 총 20개의 데이터 중의 2번째의 값의 누적확률은 0.1(2/20)이 됩니다. 전체적으로 각 데이터마다 1/20씩 증가하는계단함수가 됩니다. 이것을 경험적 누적분포함수라고 하며 이 함수가 정규분포의 누적함수와의 일치 정도로 자료의 정규성을 검정합니다. 그림 1은 100개의 랜덤 샘플에 대한 경험적 누적분포함수와 정규누적분포함수를 작성한 것입니다. np.random.seed(3) N=100 da=np.sort(np.random.randn(N)) ecdf=[i/N for i in range(1, N+1)] nCdf=stats.norm.cdf(da) plt.figure(figsize=(4,2)) plt.plot(da, ecdf, color="blue", label="ECDF") plt.plot(da, nCdf, color="red", label="normCDF") plt.legend(loc=...

[data analysis]shapiro-Wilk test

shapiro-Wilk test 관련된 내용 Q-Q plot shapiro-Wilk test Kolmogorov-Smirnov Test Anderson-Darling 검정 Jarque-Bera test 표본 x 1 , x 2 , …, x n 이 정규분포에 부합성 여부를 검정하기 위해 식 1과 같이 계산되는 shapiro-Wilk통계량인 W 를 사용하여 귀무가설(H0: 정규분포를 따릅니다.) 검정을 실시합니다. \begin{align}W&=\frac{\left(\sum^m_{i=1}a_ix_{(i)} \right)^2}{\sum^n_{i=1}(x_i-\bar{x})^2}\\x_{(i)}&=x_{n+1-i}-x_i\\ & n: \text{표본의 크기}\\ & m=\begin{cases}\frac{n}{2}&\text{for}\;n=\text{짝수}\\\frac{n-1}{2}&\text{for}\;n=\text{홀수} \end{cases}\end{align} (식 1) 식 1에서 a i 는 두 값 차이에 대한 가중치입니다. 그 가중치들은 정렬된 자료의 평균, 표준편차 등 통계량을 기준으로 산출된 상수로서 shapiro-Wilk table에서 결정할 수 있습니다. 식 1의 x (i) 를 나타내는 i는 [0, m] 사이의 정수값입니다. 즉 W값은 전체 퍼짐의 정도에서 각각의 작은값과 큰값의 차이의 비를 나타낸 값입니다. Shapiro-Wilk 검정의 W는 다음 과정으로 계산합니다. data 정렬 SS 계산 $SS=\sum^n_{i=1}(x_i-\bar{x})^2$ W의 분자인 b를 계산 $b=\sum^m_{i=1} a_i(x_{n+1-i}-x_i)$ 검정 통계량(W)계산 $W=\frac{b^2}{SS}$ shapiro-Wilk table를 기준으로 p-value를 산출 shapiro-Wilk table은 샘플수에 대한 가중치(a i )와 특정 유...

[data analysis] Q-Q plot

Q-Q plot 관련된 내용 Q-Q plot shapiro-Wilk test Kolmogorov-Smirnov Test Anderson-Darling 검정 Jarque-Bera test Q-Q(사분위수) plot은 두 자료들을 분위수로 구분한 후 동일한 분위수 값들에 대해 작성한 도표로서 두 그룹의 분포를 비교하는 방법으로 역누적분포에 의해 설명됩니다. 역누적분포 (Inverse cumulative distribution) 는 누적분포의 역함수입니다. 예를 들어 표준정규분포의 누적분포와 역누적분포는 그림 1과 같이 나타낼 수 있습니다. 그림 1. 표준정규분포의 (a) pdf, cdf와 (b)역누적확률분포. x=np.linspace(-3, 3,1000) pdf=stats.norm.pdf(x) cdf=stats.norm.cdf(x) q=np.linspace(0, 1, 1000) ppf=stats.norm.ppf(q) plt.figure(figsize=(8, 5)) plt.subplots_adjust(wspace=0.3) plt.subplot(1,2,1) plt.plot(x, pdf, color="blue", label="PDF") plt.plot(x, cdf, color="red", label="CDF") plt.xlabel("x") plt.ylabel("probability") plt.legend(loc="best") plt.title("(a)", loc="left") plt.subplot(1,2,2) plt.plot(q, ppf, color="green", label="Inverse CDF") plt.xlabel("probaility(q)") plt.ylabel("I(q)") plt.leg...

[data analysis] 정규분포(Normal Distribution)

정규분포(Normal (Gaussian) Distribution) 여러 현상들에 대해 큰 규모의 자료를 조사하면 그림 1과 같이 평균에서 가장 높은 확률을 보이며 그 평균을 중심으로 양쪽으로 같은 정도로 확률 감소를 보이는 종 모양의 형태를 보입니다. 이러한 분포를 정규분포(normal Distribution) 라고 합니다. 특히 큰 규모의 확률변수들에 대한 분포는 그 변수들의 조건에 상관없이 정규분포에 근접하기 때문에 데이터들의 여러 특성들을 연구하는데 중심이 되는 분포입니다. 그림 1. 정규분포에서 확률과 표준편차의 관계. x=np.linspace(-4, 4, 100) p=stats.norm.pdf(x) nme=[r"-2.56$\sigma$", r"-1.96$\sigma$", r"$\sigma$", r'$\mu$', r"$\sigma$", r"1.96$\sigma$", r"2.56$\sigma$"] x1=np.linspace(-1, 1, 100) x21=np.linspace(-1.96, -1, 100) x22=np.linspace(1, 1.96, 100) x31=np.linspace(-2.56, -1.96, 100 ) x32=np.linspace(1.96, 2.56, 100) fig, ax=plt.subplots(figsize=(9,3)) ax.plot(x, p, color="r") ax.fill_between(x1, stats.norm.pdf(x1), color="g", alpha=0.3, label="68%") ax.fill_between(x21, stats.norm.pdf(x21), color="b", alpha=0.3, label="95%") ax.fill_between(x22, stats.norm.pdf(x22), color...

[data analysis]상관분석(Correlation analysis)

상관분석(Correlation analysis) 상관분석은 두 개 이상의 자료에 대한 상관 관계를 분석하는 것으로 분석의 모수는 상관계수(ρ) 가 됩니다. 식 1에서 나타낸 것과 같이 분석의 귀무가설은 ρ = 0입니다. 다시 말해 비교하는 자료들 사이의 상관성은 존재하지 않음을 검정하는 것입니다. H0 : ρ = 0, H1 : ρ ≠ 0 (식 1) 일반적으로 상관계수는 ρ 또는 r로 나타냅니다. 상관계수(r)에 대한 분포는 평균 0이며 범위는 [-1, 1] 이므로 그 분포의 분산은 1 - r 2 로 나타낼 수 있습니다. 이 확률변수는 경계값과 평균이 고정되므로 자유도는 n - 2인 t분포를 따릅니다. 그러나 자유도가 클 경우는 정규분포를 적용합니다. 확률변수의 표준오차와 검정통계량은 식 2로 계산됩니다. \begin{align}\text{SE}&=\sqrt{\frac{1-r^2}{n-2}}\\ \text{statistic}& = \frac{r-\mu_r}{\sqrt{\frac{1-r^2}{n-2}}}\\ & = \frac{r}{\sqrt{\frac{1-r^2}{n-2}}}\\ \text{SE}:&\,\text{표준오차}\end{align} (식 2) 식 2에서의 검정통계량은 상관계수를 표준화한 것으로 표준 정규분포 또는 표준 t 분포를 기반으로 검정합니다. 검정에 t-분포 또는 정규분포를 적용할 경우 통계량은 상관계수가 됩니다. 예 1) 일정기간의 kos와 ex의 일일 종가에 대한 상관분석을 실시합니다. ex kos 0 1260.91 2218.68 1 1270.10 2255.98 2 1279.08 2264.65 3 1271...

[data analysis] 카이제곱 검정($\chi^2$ test)

카이제곱 검정(χ 2 test) 카이제곱검정($\chi^2$ 검정) 은 카이제곱분포(chi-squared distribution) 를 기준으로 귀무가설을 검정하는 분석 방법입니다. 카이제곱분포는 2개 이상의 독립적으로 정규분포를 따르는 변수들의 제곱으로 생성됩니다. 예를 들어 식 1과 같이 표준화된 변수들의 제곱은 자유도가 1인 카이제곱 분포에 부합합니다. $$Y=\left(\frac{x_i-\mu}{\sigma} \right)^2$$ (식 1) 그러므로 카이제곱 분포에 부합한다는 것은 비교되는 샘플들 간의 독립임을 의미합니다. 즉, 카이제곱 검정의 귀무가설은 다음과 같습니다. H0: 각 그룹들은 독립입니다. 예 1) 코스피 지수(kos)에 대해 하루 앞선 원화 환율(ex)의 일일 시가 대비 종가의 상승과 하락에 대한 두 자료는 독립적임을 검정합니다. 이 자료를 작성하기 위해 FinanceDatareder.DataReader() 함수로 특정한 기간의 금융자료를 호출하였습니다. 호출된 자료는 연속변수로서 목록변수로 전환하기 위해 pd.cut() 함수를 적용합니다. 또한 두 데이터들을 결합하기 위해 pd.concat() 를 적용합니다. st=pd.Timestamp(2022,1,1) et=pd.Timestamp(2023, 4, 10) kos=fdr.DataReader('KS11', st, et)["Close"] ex=fdr.DataReader('USD/KRW',st, et)["Close"] kos=kos.pct_change()[1:]*100 ex=ex.pct_change()[1:]*100 kos1=pd.cut(kos, bins=[kos.min()-0.1, 0, kos.max()+0.1], labels=[0, 1]) ex1=pd.cut(ex, bins=[ex.min()-0.1, 0, ex.max()+0.1], labels=[0, 1]) data=pd.concat([ex...

[data analysis] 두 대규모 표본의 비교

두 대규모 표본의 비교 내용 두 독립집단의 비교 등분산인 두 소규모 표본의 비교 이분산인 두 소규모 표본의 비교 두 대규모 표본의 비교 중심극한정리 에 의하면 큰 규모의 표본은 정규분포에 부합합니다. 일반적으로 자료의 갯수가 30개 이상이면 정규분포를 따른다고 가정합니다. 이 경우는 모분산이 동일하다는 가정은 필요하지 않으며 두 표본으로부터 평균의 차 역시 정규분포를 가정할 수 있습니다. 그러므로 큰 규모의 표본들의 X-Y의 결합분포의 평균과 분산은 식 1과 같이 계산됩니다. \begin{align}μ_{\text{pred}}&= μ_x − μ_y\\ \sigma_{\text{pred}}^2 & = \frac{\sigma_x^2}{n_x}+\frac{\sigma_y^2}{n_y}\quad \text{for:}\; \sigma^2\to \text{known}\\\sigma_{\text{pred}}^2 & = \frac{s_x^2}{n_x}+\frac{s_y^2}{n_y}\quad \text{for:}\; \sigma^2\to \text{unknown}\\ &\mu,\, n:\,\text{평균, 샘플의 크기}\\& \sigma,\, s:\, \text{모표준편차, 표본표준편차} \end{align} (식 1) 예 1) 다음은 일정기간 코스피(kos)지수와 다우(dj)지수의 일일 시가 기준 종가의 변화율에 대한 자료입니다. kospi dow 0 -1.079 NaN 1 -0.551 -0.038 2 2.267 0.315 3 -0.157 -0.788 ⋮ ⋮ ⋮ ...

[data analysis]이분산인 두 소규모 표본의 비교

이분산인 두 소규모 표본의 비교 내용 두 독립집단의 비교 소규모 표본에서 등분산 이분산인 두 소규모 표본의 비교 두 대규모 표본의 비교 소규모 표본의 경우 다음 2가지 가정하에 t분포를 기준으로 가설검정을 실시합니다. 가정 1: 각 모집단이 정규분포를 따름 가정 2: 두 모분산이 동일 가정 1의 경우 모집단이 크다면 중심극한 정리에 의해 정규분포를 가정하는 것은 합리적입니다. 정규분포는 표준화에 의해 각 모집단의 분포의 분산은 같아집니다. 그러나 정규분포의 가정이 불확실할 경우 가정 2역시 불확실성을 가집니다. 이러한 경우는 각 표본의 분산 정도에 따라 판단합니다. 두 표본 표준편차의 비가 0.5와 2사이에 존재한다면 등분산으로 가정할 수 있습니다(식 1). $$0.5 ≤ \frac{s_1}{s_2} \le 2$$ (식 1) 위 식의 조건에 부합하지 않은 경우 또는 다른 이유로 등분산 가정이 적용되기 어려운 경우 등분산을 가정한 합동분산은 적용할 수 없습니다. 대신에 식 1과 같이 계산되는 결합확률분포의 합동분산을 적용합니다. \begin{align}E(X-Y)&=E(X)-E(Y)\\&=\mu_x-\mu_y\\\text{Var}(X-Y)&=\text{Var}(X)+\text{Var}(Y)-\text{Cov}(X,Y)\\ &=\frac{\sigma_x^2}{n_x}+\frac{\sigma_y^2}{n_y}\\&\text{Cov}(X,Y)=0\quad \because\;X,\,Y:\text{독립}\\& n: \text{샘플의 크기}, \; \mu: \text{평균},\;\sigma: \text{표준편차}\end{align} (식 1) 이 결합분포의 표준편차는 각 그룹의 샘플 규모를 고려한 것으로 결합분포의 표준오차로 사용할 수 있습니다. 소규모 표본이므로 t 분포를 기준으로 분석을 시행하기 때문에 자유도 선택의 문제가 존재합니다. 합동분산인 경우 자유도는 n 1 ...

[data analysis]등분산인 두 소규모 표본의 비교

등분산인 두 소규모 표본의 비교 내용 두 독립집단의 비교 등분산인 두 소규모 표본의 비교 이분산인 두 소규모 표본의 비교 두 대규모 표본의 비교 일반적으로 자료의 규모가 30이하일 경우 정규분포 대신 t분포를 사용합니다. 또한 동일 모집단이나 유사한 모집단에서 추출된 표본으로 동일한 분산이라고 가정할 수 있다면 결합분포는 식 1와 같이 나타낼 수 있습니다. \begin{align} \bar{x}-\bar{y}&\;\sim\;\left(\mu_x-\mu_y,\; \sigma^2\left(\frac{1}{n_x}+\frac{1}{n_y} \right) \right)\\&n: \text{샘플의 크기}, \; \mu: \text{평균},\;\sigma: \text{표준편차}\end{align} (식 1) 표준정규분포를 기반으로 하는 분석 즉, z-검정을 위해서는 식 2를 적용해 각 표본의 평균에 대한 z 통계량 계산합니다. $$Z=\frac{x-\mu}{\sigma}$$ (식 2) 그러나 현실적으로 모표준편차 (σ)는 알 수 없는 경우가 많습니다. 이러한 경우 불편추정치로 표본분산(s 2 )를 사용합니다. 자료의 규모가 작은 경우 위 z 통계량은 자유도를 모수로 하는 t 분포를 따르며 그 분포의 검정 통계량인 t 통계량은 식 3과 같이 계산됩니다. \begin{align}t& =\frac{\bar{x}-\mu}{\frac{s}{n}}\;\sim\;t(\text(자유도))\\ \bar{x}&=\frac{\bar{x_1}+\bar{x_2}+\cdots +\bar{x_n}}{n}\\s^2&=\frac{\sum^n_{i=1}(x_i\bar{x})^2}{n-1}\end{align} (식 3) 동일한 분산을 가진다고 가정할 수 있는 경우 두 집단의 결합분포 표준편차로 합동표준편차(pooled standard deviation) 를 사용합니다. 식 4와 같이 정의되는 합동표준편차...