원-핫 인코딩을 위한 함수들

전달되는 데이터인 x는 1차원 Array, pandas Series, 그리고 DataFrame 모두 가능
데이터의 고유값(unique value)에 대응하는 클래스를 생성하여 값에 적합한 클래스에 True, 나머지 클래스에 False를 할당(one-hot encoding)
- True와 False로 표시가 기본값
- 인수 dtype = "int": True → 1, False → 0
dummy_na = True: 데이터의 포함된 Na를 포함

pd.get_dummies(['A', 'A', 'C', 'C', 'B'])

pd.get_dummies(['A', 'A', 'C', 'C', 'B'], dtype='int')

y=pd.DataFrame([['A', 'A', 'C', 'C', 'B'],['B', 'A', 'C', 'A', 'B']])
pd.get_dummies(y)

	0_A	0_B	1_A	2_C	3_A	3_C	4_B
0	True	False	True	True	False	True	True
1	False	True	True	True	True	False	True

특정한 값에 해당하는 인덱스에 1, 나머지는 0을 할당하는 방식으로 데이터 변환하는 클래스
전달하는 인수는 2차원 이상의 배열 구조 이어야 합니다.
.fit(data): estimator 생성하는 메서드
.transform(data): 변환된 결과를 생성하는 메서드. 이 결과는 자료형이 지정되지 않은 상태로 .toarray() 메소드에 의해 array 형으로 전환한 후 나타냄
위의 두 메소드를 결합하여 .fit_transform(data)로 처리할 수 있습니다.
.inverse_transforme(변환된 data): 원시데이터로 환원된 결과를 반환하는 메소드
.categories_ : data의 클래스(목록)를 즉, 각 변수의 고유값을 반환하는 속성

sons dataStory