목록2026/05/15 (2)
co-code 님의 블로그
랜덤 포레스트(RandomForest)배깅 방식을 활용데이터 샘플링 방식 + 다수결 or 평균 사용사용하는 모델은 의사결정나무 고정 (랜덤포레스트 안에 의사결정나무가 하드코딩되어있음)각 노드에서 분할 할때마다 모든 피치에서 일부만 무작위로 선택하여 트리간의 상관성을 낮춰준다. -> 다양성 증가여러 결정 트리를 서로 다르게 학습 시킨 뒤 다수결(분류), 평균(회귀)으로 예측하는 배깅 기반의 앙상블부트스트랩(중복 데이터를 허용)과 특성의 무작위 선택을 이용해 모델 간의 상관성을 낮춰서 성능과 안정성을 높이는 방법고차원 데이터에서 안정성이 굉장히 높다대부분의 실무에서 많이 사용이 되느 알고리즘paramer(매개변수)n_estimators기본값 : 100모델의 개수를 지정criterion분류 : gini(기본값..
앙상블단일 의사결정나무(DecisionTree)의 단점을 극복하기 위해 머신러닝 모델을 연결하여 더 강력한 모델을 만드는 과정주어진 자료로부터 여러개의 예측 모델을 만든 후 예측 모형을 조합하여 하나의 예측 모형을 생성하는 과정대표적인 기법 : 배깅, 부스팅, 랜덤 포레스트배깅주어진 자료를 모집단으로 간주하여 주어진 자료에서 여러개의 부트스트랩 자료를 생성하고 각각의 부트스트랩 자료에 예측 모델을 만든 후 결합하여 최종 모델 완성장점분산을 줄이고 과적합의 문제를 완화안정적인 성능 보장비선형 구조의 데이터와 노이즈 데이터에 대한 문제가 완화parameter(매개변수)estimator기본값 : None기본 모델을 설정n_estimators기본값 :10생성시킬 모델의 개수max_samples기본값 : 1.0생..