co-code 님의 블로그

제 3회 기출 복원 문제 오답 정리 본문

빅분기 공부

제 3회 기출 복원 문제 오답 정리

co-code 2026. 8. 1. 19:50
  • 1과목
    • GDPR(General Data Protection Regulation)
      • 유럽 연합의 법으로서 개인정보 활용 범위와 데이터 비식별화를 통한 개인정보 방안 제시
      • 유럽 연합에 속해 있거나 유럽 경재 지역에 속해 있는 모든 사람들의 사생활 보호와 개인정보들을 보호해줌
    • 데이터 품질 관리 특성
      • 정확성
        • 분석 객체에 대한 올바른 값을 오류 없이 저장하는 특성
        • 내재적(고유) 데이터 품질 특성 (Intrinsic Data Quality)
      • 완전성 : 데이터 식별 수준 만족 (대상, 속성 포함)
      • 일관성 : 규정, 포맷, 형식 유지
      • 적시성 : 유효한 시간 정보 확인 (소멸성이 높은 데이터에 대한 품질 기준)
    • 데이터 웨어하우스 (Data Warehouse)
      •  주제 중심적
      • 통합적 내용 저장
      • 시간성을 가지는 비휘발성(비소멸성) 자료의 집합 저장
    • 아파치 우지 (Apache Oozie)
      • 아파치 하둡(Apache Hadoop)의 Job을 관리하기 위한 위크플로우 스케쥴링 시스탬
        • 워크플로우 : 방향성 비사이클 그래프애서 제어 흐름과 액션 노드의 모임
          • 제어 흐름 : 워크플로우 시작과 끝(시작, 끝, 실패 노드) 그리고 워크플로우 실행 경로를 제어하기 위한 구조(결정, 포크, 조인 노드) 정의
  • 2과목 
    • 주성분 분석 (PCA, Principal Component Analysis)
      • 서로 연관가능성이 있는 고차원 공간의 표본들을 선형 연관성이 없는 저차원 공간(주성분)의 표본으로 변환하기 위하여 직교 변환을 사용한다.
      • 공분산 행렬을 이용하여 고유 벡터를 구하며, 공분산 행렬의 고유 벡터가 해당 데이터를 대표하는 주축(주성분)이 된다.
      • 주성분이 가장 큰 분산을 가지도록 하고, 이후의 주성분들은 이전의 주성분들과 직교하나는 제약 아래에 가장 큰 분산ㅇ르 갖고 있다는 식의 개념을 이용한다.
    • 박스칵스 변환 (Box-cox Transformation)
      • 로그 변환과 거듭곱 변환을 둘다 포함
      • 데이터를 정규 분포에 가깝게 만들거나 데이터의 분산을 안정화하는 용도로 사용
    • 군집 추출 (Clustering Random Sampling)
      • 이질적인 군집(집락)으로 구분하고 난 뒤 무작위로 몇 개의 군집을 표본으로 추출하고 군집에 대해서 그 구성요소를 전수조사하거나 표본조사하는 방법으로 표집된다.
    • 중심극한정리(Central Limit Theorm)
      • 왜도 값과 무관하게 하느이 모집단에서 임의로  추출된 표본의 크기가 큰 경우 표본 평균은 정규분포를 따른다
    • 가설 검정 관련 개념
      • 검정통계량 : 모집단의 부분집합인 표본으로부터 검정에 대한 결론을 내리고 귀무가설을 기각하거나 채택하는 결정을 내리는데 활용되는 표본의 함수
      • 기각역 : 가설 검정에서 가설을 통해 얻어진 검정 통계량을 어떤 범위 내에 들어오면 이 가정을 옳지 않다고 판단하며, 이때의 범위 값
      • 제 2종 오류 (β) : 대립가설이 맞다고 가정할 때, 주어진 검정통계량을 이용하여 대립가설을 기각하면서 생기는 오류값
      • 유의확률 : 귀무가설이 맞다고 가정할 때, 주어진 검정 통계량을 이용하여 구한 최소의 유의수준 값
  • 3과목
    • 다중 공선성 문제 해결 방안
      • 다중 공선성 문제를 일으키는 독립(설명)변수들 중 하나 혹은 일부 제거
      • 릿지(Ridge) 함수를 이용하여 모형의 가중치를 제한하고 다항식 차수 감소시킴
      • 변수를 변형시키거나 새로운 관측치 이용
    • 박스칵스(Box-cox) 변환
      • 로그변환과 거듭곱 변환을 모두 포함
      • 데이터를 정규분포에 가깝게 만드거나 데이터의 분산을 안정화하는 용도로 사용
    • 분산분석(ANOVA : Analysis of Variance)표
      • 유의확률(p-value) < 유의수준(α)이면 회귀식이 유의하다고 판정
      • 종속변수의 표본분산 : SST/(n-1)
      • 기본적인 가정을 토대로 이루어짐
        • 독립/종속변수의 선형성
        • 오차의 정규성, 등분산성, 독립성
      • 결정계수(종속변수의 전체 분산이 회귀식에 의해 설명되는 비율)이 클수록 좋은 회귀 모형
요인 제곱합 자유도 제곱평균 F
회귀 SSR 1 MSR=SSR/1 F=MSR/MSE
잔차 SSE n-2 MSE=SSE/(n-2)
전체 SST n-1 -
  • 인공신경망의 하이퍼파라미터
    • 하이퍼파라미터 : 학습률, 은닉층의 개수, 배치 크기, 훈련 반복횟수, 손실 함수, 가중치 초기화
    • 파라미터 : 가중치, 편향(Bias), 결과값
  • 자기 상관 (Auto Correlation)
    • 시간 또는 공간적으로 연속된 일련의 시계열 관측값들 사이에 존재하는 상관관계
    • 시계열 데이터에서 시차 값 사이의 선형관계 측정 위해 사용됨
  • CNN(합성곱 신경망)
    • 합성곱 연산
    • Feature Map을 이용한 학습
    • 로봇 이미지 인식, 컴퓨터 비전, 영상분석 및 인식
  • RNN(순환 신경망)
    • 노드 간 연결이 순환 구조를 가짐
    • 주기 예측 등 순차적 데이터 처리 분야를 활용
    • 필기체 텍스트, 음성, 언어 번역
  • GAN(생성적 적대 신경망)
    • 제로섬(Zero-Sum) 게임 틀 내에서 서로 경쟁하는 신경망 활용
    • 가짜 생성 모델에 대한 진위 여부 판별 모델의 경쟁
    • 컴퓨터 게임, 패션, 광고
  • 강화학습
    • 행동심리학에서 영감을 받음
    • 마코프 프로세스 결정모델 활용
    • 게임, 제어, 정보이론, 다중 에이전트 시스템
  • 심층 신뢰 신경망(DBN : Deep Belief Network)
    • 다층의 잠재변수로 표현되는 은닉층으로 구성
    • 레이블이 없는 데이터에 대한 비지도 학습 방법 이용
    • 학습 데이터가 충분하지 않을 때 유용
    • RBM(Restricted Boltzman Machine)을 층층이 쌓아 구성
    • 부분 이미지에서 전체를 연상시키는 일반화과정 구현
    • 글씨 인식, 음성 데이터를 이용한 감성 분석에 활용됨
  • 인공신경망에서 사용되는 활성화함수(Activation Function)
    • 활성화 함수 : 입력된 가중합을 출력신호로 변환하는 함수
      • 은닉층의 수가 많아지면 매개변수의 수를 줄여 필요한 연산의 수 감소
      • 시그모이드
        • 정의역 : 실수 전체
        • 유한한 구간 사이의 한정된 값 변환
        • 정의역의 절댓값이 클수록 미분값이 0으로 수렴 ⇒ 가중치 업데이트 X, 기울기 손실 형상 발생
  • 딥러닝 심층인공신경망에서 사용되는 경사하강법
    • Momentum
    • NAG(Nesterov Accelerated Gradient)
    • AdaGrad(Adaptive Gradient)
    • RMSProp
    • AdaDelta
    • Adam(Adaptive Momentum Estimation)
  • 앙상블(Ensemble) 기법
    • 배깅(Bagging) : Bootstrap + Aggregation
      • 샘플을 여러번 뽑아 각 모델을 학습시켜 결과물을 집계
      • EX) Random Forest
    • 부스팅(Boosting)
      • 가중치를 활용하여 약 분류기를 강 분류기로 만드는 방법
      • AdaBoost, XGBoost, Arc-x4
    • 윌콕슨 부호순위 검정
      • 두 모집단에 대한 분포의 가정이 어렵거나 표본의 가정이 어렵거나 표본이 순위로밖에 표현될 수 없을 때, 두 모집단의 확률분표가 동일한지에 대한 가설 검정
    • 프라이드만(Friedman) 검정
      • 동일한 케이스에 대해 반복된 측정이 이어졌을 때 세 개 이상의 집단 비교를 위해 사용되는 비모수 검정 방법
  • 4과목 
    • 평균 절대 백분 오차 비율 (MAPE : Mean Absolute Percentage Error) 
      • 실제 데이터에서 오차가 어느 정도 비율로 발생했는지 평가하기 위하여 종속변수 값 대비 예측 오차 비율의 절대값을 평균한 값
    • 인공 신경망 과적합 방지 방법
      • 모델의 복잡도 줄이기 (은닉층 or 매개변수 수 줄이기)
      • 가중치 규제
      • 드롭아웃 (학습과정에서 신경망의 일부를 사용하지 X)
      • 적절한 학습률 유지
      •  
    • 혼동 행렬
      • 민감도(Senstivity, Recall) =TP/(TP+FN)
      • 정밀도(Precision)=TP/(FP+TP)
구분 예측 범주값
Yes(참) No(거짓)
실제 범주값  Yes(챰) O (TP : True Positive) X (FN : Fale Negative)
No(거짓) X (FP : False Positive) O (TN :True Negative)