co-code 님의 블로그

제 4회 기출 복원 문제 오답 정리 본문

빅분기 공부

제 4회 기출 복원 문제 오답 정리

co-code 2026. 8. 1. 20:30
  • 1과목
    • 빅데이터 분석을 위한 로드맵
      • 소요 비용 배분, 프로젝트 WBS 수립, 업무 분장 계획 수립
      • 로드맵 작성 위해 우선 고려할 사항
        • 비즈니스 성과 및 ROI 평가, 데이터 분석의 시급성, 데이터 탐색 등
    • 고품질 데이터의 특성
      • 정확성 (분석 대상에 대한 올바른 값 사용)
      • 완전성 (결측치 등의 오류가 없음)
      • 적시성 (유효한 시간 정보 포함)
      • 일관성 (일관된 속성, 규정, 포맷 및 형식 유지)
    • 데이터 비식별화 방법
      • L-다양성 : 주어진 데이터셋에서 함께 비식별되는 레코드들은 동질 집합에서도 적어도 L개의 서로 다른 민감한 정보를 가져야하는 성질
      • 개인정보 차등 보호 : 데이터에 수학적 노이즈를 추가(속성의 값을 원래의 값과 다르게 변경)하는 기술
    • 분산 파일 시스템 (Distributed File System)
      • 다수의 사용자가 원격으로 데이터를 쉽게 공유할 수 있도록 함
      • 데이터의 가용성(Availability)을 향상시킴
      • 데이터를 물리적으로 다른 위치에 중복하여 저장함으로써 디스크에 장애가 발생하더라도 단일 서버 환경에서보다 상대적으로 쉽게 복구될 수 있도록 설계됨
      • EX) GFS, HDFS
        • HDFS (Hadoop File System)
          • GFS(Google File System)를 모델로 하여 만들어진 오픈소스 (GFS와 동일한 특징 O)
          • 대용량의 파일을 Chunk라는 단위로 분할해 Data Node에 분산 저장
            • Data Node : 블록 복제의 횟수 관리
          • Chunk가 어느 데이터 노드에 저장되었는지에 대한 메타 데이터는 Name Node에 저장
            • Name Node : 클라이언트가 하둡 처리에 대한 요청을 직접 접수
          • MapReduce 프레임워크를 이용해 분산저장된 파일을 읽어 연산 기능 수행
      • 2과목 
        • 인 메모리(In-Memory) 기반 데이터 처리 방식
          • 디스크 기반 컴퓨팅과 달리 데이터를 하드 디스크에 저장하고 관리하는 것이 아니라, 전체 데이터를 메모리에 적재하여 사용
          • 아파치 스파크(Apache Spark)
            • 대용량의 데이터를 효율적으로 처리하기 위한 오픈 소스 클라우드 플랫폼으로 RDD(Resilient Distributed Dataset)라고 부르는 인-메모리 처리 방식
            • 머신러닝과 그래프 알고리즘과 같은 반복적인 어플리케이션에 적합
        • Ridge Regression (릿지 회귀)
          • 추정 계수의 제곱합을 최소로 하는 회귀 분석 모형을 찾음
          • 제곱합을 최소화하기 때문에 계수의 크기가 줄어들어 과적합이 방지되고, 다중 공선성이 분산되어 효과적
        • 주성분 분석 (PCA, Principal Component Analysis)
          • 변수들의 상관관계를 이용하여 기존 변수들을 분산이 큰 변수들로 변환시켜서 유의성이 높은 변수들로 데이터를 표현함으로써 저차원의 데이터로 나타낸다 (차원축소 기법)
          • 새로 생긴 변수들은 서로 상관관계가 없도록 설계됨
          • 새로운 변수를 정의하기 때문에 문제의 원인을 추론하기 어려워 직관적 이해가 다른 기법에 비해 다소 어려움
        • 시공간 데이터
          • 지리 통계 데이터
          • 그리드 (래스터) 데이터
          • 격자 데이터
          • 포인트 패턴
          • 궤도 데이터
        • 초기하분포 (Hypergeometric Distribution)
          • 유한 모집단에서 비복원 추출의 경우 성공의 수를 확률변수 X로 정의한다면, 확률변수 X의 분포가 초기하분포
  • 3과목
    • 분류를 위한 종속 변수가 범주형인 경우 사용되는 데이터 분석모형
      • 인공 신경망
      • 서포트 벡터 머신
      • 의사결정나무
      • (선형회귀분석 : 독립변수가 연속형/범주형이고 종속변수가 연속형인 경우 독립변수 이용해 종속 변수 예측)
    • 의사결정나무
      • 이산형(범주형) 목표 변수의 경우 목표변수의 각 범주에 속하는 빈도, 연속형(구간형) 목표변수의 경우 목표 변수의 (평균, 표준편차)에 기초하여 분리가 일어남
      • 분리 기준으로 사용되는 C4.5(혹은 C5.0)알고리즘에서는 엔트로피 지수 사용
      • 분리 기준으로 사용되는 CHAID, QUEST 알고리즘에서는 카이제곱 통계량을 이용한 F-검정 방법 이용
      • 목적과 자료구조에 따라 적절한 분리기준과 전지 규칙을 지정하여 의사결정나무 모형 구축
      • 분류 오류를 크게할 위험이 높거나 부적절한 가지를 제공함으로써 한 범주에 한 종류의 데이터가 남을 때까지 가지치기 수행
    • 시계열 자료의 특성
      • 계절(Seasonality)
      • 불규칙(Irregular)
      • 추세(Trend)
      • 주기(Cycle)
        • 시계열 자료에서 고정되지 못하고 증가하거나 감소하는 형태로 나타날 때 주기가 있다고 함
        • 주로 경제 상황에서 이런 형태가 나타남
        • 변화가 계절에 의한 것이 아니고, 주기가 긴 경우의 변동 자료에서의 패턴을 나타낼 때 사용
      • 윌콕슨 부호순위 & 부호순위합 검정
        • 모집단이 정규성을 만족하지 못할 때 사용
        • 정규성 검정에서 정규분포를 따르지 않거나 표본의 수가 10개 미만의 소규모로 정규분포를 가정할 수 없을 경우에 순위 데이터를 이용한 비모수적 검정 방법 이용
  • 4과목
    • ROC (Receiver Operating Charactristic)
      • X축 : 1-특이도 (FPRate)
      • Y축 : 민감도 (TPRate)
        • 민감도가 동일할 때 특이도가 클수록(FPRate 값이 작을수록) 분석 모형의 성능이 우수함
        • (민감도, 특이도)=(1,0)인 점과 (민감도, 특이도)=(0,1)인 점을 지남
        • 가장 이상적인 ROC 그래프는 (민감도, 특이도)=(1,1)인 점을 지남
    • 과대적합 (Overfitting) 방지 기법
      • 정보의 양과 종류에 규제(Regulation) 부과
      • 학습 과정에서 일부를 사용하지 않는 Dropout 적용
      • 정해진 크기 안에서 가장 큰 값만 추출하는 Max Pooling 기법
    • 히스토그램(Histogram)
      • 양적 자료 표현에 사용됨 (w. 꺾은선 그래프, 누적 백분율 곡선)
        • ↔ 질적 자료 표현에 사용됨 : 막대 그래프(Bar Chart), 파이 차트(Pie Chart)
      • 종속 변수를 확률 단위로 표현 가능
      • 데이터를 잘 표현하려면 구간을 잘 정해야 함
      • 상대도수 히스토그램에서 구간의 간격으로 상대도수를 나누면, 상대도수 히스토그램은 확률밀도함수를 나타냄
    •