목록2026/05/08 (2)
co-code 님의 블로그
데이터 불균형 문제정상을 정확하게 분류하는 것과 이상을 정확하게 분류하는 것 중 이상을 정확하게 분류하는 것이 더 중요함일반적으로는 정산의 데이터가 이상의 데이터보다 많다.데이터의 불균형이 발생할 수 있다.target 데이터에서 0(정상), 1(이상) 중 0 판단을 더 많이 하게 되는 경우가 발생할 수 있음(예측력이 떨어짐)소수의 데이터의 중요도가 낮게 판단이 되어 실제 모델에서는 해당하는 예측이 적게 발생다수의 데이터와 소수의 데이터의 특정 비율로 조절해주는 샘플링 기법이 존재(언더 샘플링, 오버 샘플링)샘플링을 사용하기 위한 라이브러리(imbalanced-learn) 설치 필요!pip install imbalanced-learn언더 샘플링다수의 라벨을 가진 데이터를 샘플링하여 소수의 데이터의 개수만큼..
이상치값이 이상한 데이터결측치결측치를 확인하는 방법isna() 함수를 이용하여 결측치 유무 판단sum() 함수를 이용하여 결측치 개수 확인info() 함수를 이용하여 non-null count 확인범위를 벗어나는 데이터특정 범위를 벗어나는 데이터를 확인하는 방법unique() 함수를 이용하여 특정 필드의 유일 데이터 확인value_counts() 함수를 이용하여 특정 필드와 데이터들의 빈도수 확인isin() 함수를 이용하여 특정 값들에 포함되어있는가를 확인하고 부정연산자(비트연산자(-))를 이용하여 데이터를 대입값이 크게 벗어나는 데이터(극단치)극단치 확인하는 방법IQR방식boxplot()의 수염의 경계Q3(3사분위수)와 Q1(1사분위수)를 이용하여 극단치의 범위를 지정IQR = Q3 - Q1극단치의 경..