co-code 님의 블로그

제 5회 기출 복원 문제 오답 정리 본문

빅분기 공부

제 5회 기출 복원 문제 오답 정리

co-code 2026. 8. 4. 23:54
  • 1과목
    • 데이터 직군
      • 데이터 분석가
        • 데이터를 분석·정리하여 비즈니스 결정 시 도움을 줄 수 있는 데이터 분석 보고서 제작
      • 데이터 사이언티스트
        • 비즈니스 문제를 정의하고 문제를 해결하기 위한 데이터 분석 모형을 제작
      • 데이터 아키텍트
        • 조직 내 잠재적인 데이터 소스 평가 후 이를 통합·집중화하고, 보호·관리 계획을 설계하며, 데이터 관리 시스템의 선을을 지속적으로 모니터링하여 보고
      • 데이터 엔지니어
        • 내부·외부 원천 데이터를 수집·가공·적재하여 데이터의 흐름(파이프라인)을 설계·구축
    • CRISP-DM(Cross Industry Standard Process for Data Mining)
      • 체계화된 절차와 방법으로서 계층적 데이터 분석 프로세스 모델
      • 분석 단계
        • 비즈니스 이해 → 데이터 이해 → 데이터 준비 → 모델링 → 평가 → 전개
    • 데이터 수집 방법
      • 실시간 데이터 : 오픈 API
      • 웹 로그 데이터 : Apache Flume, Scribe, Chukwa 등의 Log Collector 이용
      • 웹 메타 데이터 : 스크래핑
      • 웹 문서 데이터 : 크롤링
    • 병렬 DBMS
      • 다양한 동작의 병렬 컴퓨팅을 통해 성능을 개선하고 데이터의 중복의 가능성을 낮게 함
      • 다중 중앙처리장치와 디스크를 병렬로 사용함으로써 데이터 처리 및 밉출력 속도를 개선
      • 데이터 적재, 색인 빌드, 쿼리 평가 등의 다양한 동작의 병렬 컴퓨팅을 통해 성능 개선
      • 일반적으로 Massive Parallel Processing 구조이며, 대량의 데이터를 빠르게 적재하고 저장
    • 서비스형 인프라스트럭쳐 플랫폼
      • 서버, 스토리지, 네트워크를 필요에 따라 인프라 자원을 사용할 수 있도록 클라우드 서비스 제공
      • EX)서버 가상화, 데스크톱 가상화 등
  • 2과목 
    • 박스 플롯(Box-Plot)
      • 데이터를 탐색하고 시각화하여 패턴을 식별하기 위하여 박스플롯 이용
      • 제 1 사분위수는 전체 데이터 중 하위 25%에 해당하는 값
      • 제 2 사분위수는 중앙값(Median)과 동일
      • 제 3 사분위수는 전체 데이터 중 상위 25%에 해당하는 값
    • 클래스 불균형 문제 처리 방법
      • 반복 샘플링(Resampling)
      • 언더 샘플링(Undersampling)
      • 오버 샘플링(Oversampling)
    • 데이터 정규화
      • 분석 모형 구축 시 학습 값들이 적당한 범위를 유지하도록 모형에 입력할 데이터를 반환하는 작업
    • 데이터 분석 모형 구축 시 고려 사항
      • 비용 민감학습 : 소수 클래스 데이터에 더 민감하게 학습하도록 더 큰 클래스 가중치 (비용함수) 지정
    • 포아송 분포 (Poisson Distribution)
      • 확률론에서 단위 시간당 또는 단위 면적(영역) 당 특정 사건의 발생 횟수를 표현하는 이산확률 분포
    • 정규성 검정
      • 데이터셋의 분포가 정규분포를 따르는 지 검정
        • 검정 방법
          • 샤피로 윌크 테스트 (Shapiro-wilk Test)
          • 콜모고로프-스미르노프 검정(Kolmogorov_smirnov Test) : K-S 검정
          • Q-Q 플롯 (Quantile-quantile Plot)
    • 카이스퀘어 검정 (Chi-square Test)
      • 카이제곱 분포에 기초한 통계적 검정 방법
      • 관찰된 빈도가 기대 빈도와 의미 있게 다른 지의 여부를 검정(동질성, 독립성 검정)하기 위해 사용
  • 3과목
    • 심슨의 역설 (Simpson Paradox)
      • 각각의 변수에 신경 쓰지 않고 전체 통계 결과를 유추할 때 일어나는 오류로서 사람들의 직관과 반대되는 역설적인 상황이 발생되는 현상
      • 여러 그룹의 자료를 합했을 때의 결과와 각 그룹을 구분했을 때의 결과가 다를 때
        • 부분을 단순히 합친 것 뿐인데 그 결과가 각 부분을 비교했을 때의 결과와 달라지는 것
    • 과적합(Overfitting) 감소 방안
      • 인공 신경망에서
        • 드롭 아웃 (Dropout)
        • 데이터 학습률 조정
        • 은닉층 노드 삭제
      • 의사결정나무 분석에서 
        • 가지치기 (Tree Pruning)
          • 의사결정나무에서 과적합을 줄이고 일반화 가능성을 증대시키는 Sub-Tree를 찾는 과정
          • 의사결정나무에서 과적합을 방지하기 위해 적절한 수준에서 Terminal Node를 결합해 줌
      • 인자 분석 (Factor Analysis)
        • 분석 대상의 변수들이 상호 연관성을 가지고 소수의 요인으로 분석되는 경우에 사용되고 해당 요인들을 찾아서 변수를 줄이는 차원 축소 방법
        • 상호 연관된 여러개의 변수들 간의 내부적 상호관계를 변수들 간의 내재하는 소수의 잠재적인 관측 불가능한 인자를 추출해내는 다변량 분석 방법 
        • 인자 분석을 위해 사용되는 공분산 행렬에서의 행, 열의 수는 분석 대상의 변수의 수에 따라 결정됨
        • 회귀 분석, 상관분석, 판별 분석에 사용될 적은 수의 변수를 새롭게 만들기 위해서 사용
      • 앙상블 분석
        • 여러가지 분석 모형을 조합해 정확도가 높은 최종 모형을 만듦
        • 단일 분류기보다 신뢰성이 높은 예측값을 도출한다.
        • 대표적으로  Voting, Bagging, Boosting 방법 이용
        • 최적화 방법
          • 여러 개의 데이터 분석 모형을 조화롭게 학습시키기
          • 훈련 데이터셋을 무작으로 다른 데이터셋으로 만들어서 결정트리 분류기를 만들고, 많은 모형들 중에서 가장 많은 선택을 받은 클래스를 예측
          • 훈련 데이터셋의 중복을 허용하여 샘플링하거나 약한 학습기  여러 개를 서로 연결하고 보완해 가면서 더욱 강한 학습기를 만듦
      • 4과목
        • ROC(Receiver Operating Curve) 그래프
          • 성능 평가 지표들 중 거짓긍정률(1-특이도)과 참긍정률(민감도)을 이용하여 표현한 곡선
            • 거짓긍정률과 참긍정률은 혼동행렬로부터 구할 수 있음
          • 긍정 범주와 부정 범주를 판단하는 기준치의 변화에 따라 참긍정과 거직긍저으이 비율이 어떻게 변화하고 있는지 파악하기 위해 사용됨
        • 과대적합
          • 머신러닝에서 자주 발생하며, 데이터 분석모형이 과대적합일 때 일반적으로 분산이 큼
          • 차수가 높은 비선형 모형의 경우 학습 데이터에만 너무 맞춘 학습이 이뤄져서 정작 테스트 환경에서 는 오히려 예측 정확도가 떨어짐
            • ⇒ 차수가 높을 수록(비선형 모형일수록) 과대적합의 문제가 크게 발생함
          • 스토리텔링(Storytelling) 수행 절차
            • 사용자별 데이터 세트 및 정의 → 사용자 시나리오 작성 → 스토리보드 기획
          • 시각화 방법
            • 관계 시각화
              • 버블 차트 (Bubble Chart)
              • 산점도 (Scatter Plot)
              • 히스토그램 (Histogram)
            • 비교 시각화
              • 체르노프 페이스 (Chernoff Face)
              • 히트맵 (Heat Map)
              • 스타 차트 (Star Chart)
              • 평행 좌표 그래프 (Parallel Coordinate Plot)
          • 데이터 분석 결과에 대한 산출물
            • 데이터 분석 계획서
            • 분석 모형별 예측 결과 보고서
            • 효과 검증 프로젝트 결과 보고서 ( or 비즈니스 성과 보고서)
            • 분석 모형 유지 보수 가이드