co-code 님의 블로그
co-code
« 2026/08 »
| 일 |
월 |
화 |
수 |
목 |
금 |
토 |
| |
|
|
|
|
|
1 |
| 2 |
3 |
4 |
5 |
6 |
7 |
8 |
| 9 |
10 |
11 |
12 |
13 |
14 |
15 |
| 16 |
17 |
18 |
19 |
20 |
21 |
22 |
| 23 |
24 |
25 |
26 |
27 |
28 |
29 |
| 30 |
31 |
|
|
|
|
|
관리 메뉴
co-code 님의 블로그
제 3회 기출 복원 문제 오답 정리 본문
빅분기 공부
제 3회 기출 복원 문제 오답 정리
co-code
2026. 8. 1. 19:50
- 1과목
- GDPR(General Data Protection Regulation)
- 유럽 연합의 법으로서 개인정보 활용 범위와 데이터 비식별화를 통한 개인정보 방안 제시
- 유럽 연합에 속해 있거나 유럽 경재 지역에 속해 있는 모든 사람들의 사생활 보호와 개인정보들을 보호해줌
- 데이터 품질 관리 특성
- 정확성
- 분석 객체에 대한 올바른 값을 오류 없이 저장하는 특성
- 내재적(고유) 데이터 품질 특성 (Intrinsic Data Quality)
- 완전성 : 데이터 식별 수준 만족 (대상, 속성 포함)
- 일관성 : 규정, 포맷, 형식 유지
- 적시성 : 유효한 시간 정보 확인 (소멸성이 높은 데이터에 대한 품질 기준)
- 데이터 웨어하우스 (Data Warehouse)
- 주제 중심적
- 통합적 내용 저장
- 시간성을 가지는 비휘발성(비소멸성) 자료의 집합 저장
- 아파치 우지 (Apache Oozie)
- 아파치 하둡(Apache Hadoop)의 Job을 관리하기 위한 위크플로우 스케쥴링 시스탬
- 워크플로우 : 방향성 비사이클 그래프애서 제어 흐름과 액션 노드의 모임
- 제어 흐름 : 워크플로우 시작과 끝(시작, 끝, 실패 노드) 그리고 워크플로우 실행 경로를 제어하기 위한 구조(결정, 포크, 조인 노드) 정의
- 2과목
- 주성분 분석 (PCA, Principal Component Analysis)
- 서로 연관가능성이 있는 고차원 공간의 표본들을 선형 연관성이 없는 저차원 공간(주성분)의 표본으로 변환하기 위하여 직교 변환을 사용한다.
- 공분산 행렬을 이용하여 고유 벡터를 구하며, 공분산 행렬의 고유 벡터가 해당 데이터를 대표하는 주축(주성분)이 된다.
- 주성분이 가장 큰 분산을 가지도록 하고, 이후의 주성분들은 이전의 주성분들과 직교하나는 제약 아래에 가장 큰 분산ㅇ르 갖고 있다는 식의 개념을 이용한다.
- 박스칵스 변환 (Box-cox Transformation)
- 로그 변환과 거듭곱 변환을 둘다 포함
- 데이터를 정규 분포에 가깝게 만들거나 데이터의 분산을 안정화하는 용도로 사용
- 군집 추출 (Clustering Random Sampling)
- 이질적인 군집(집락)으로 구분하고 난 뒤 무작위로 몇 개의 군집을 표본으로 추출하고 군집에 대해서 그 구성요소를 전수조사하거나 표본조사하는 방법으로 표집된다.
- 중심극한정리(Central Limit Theorm)
- 왜도 값과 무관하게 하느이 모집단에서 임의로 추출된 표본의 크기가 큰 경우 표본 평균은 정규분포를 따른다
- 가설 검정 관련 개념
- 검정통계량 : 모집단의 부분집합인 표본으로부터 검정에 대한 결론을 내리고 귀무가설을 기각하거나 채택하는 결정을 내리는데 활용되는 표본의 함수
- 기각역 : 가설 검정에서 가설을 통해 얻어진 검정 통계량을 어떤 범위 내에 들어오면 이 가정을 옳지 않다고 판단하며, 이때의 범위 값
- 제 2종 오류 (β) : 대립가설이 맞다고 가정할 때, 주어진 검정통계량을 이용하여 대립가설을 기각하면서 생기는 오류값
- 유의확률 : 귀무가설이 맞다고 가정할 때, 주어진 검정 통계량을 이용하여 구한 최소의 유의수준 값
- 3과목
- 다중 공선성 문제 해결 방안
- 다중 공선성 문제를 일으키는 독립(설명)변수들 중 하나 혹은 일부 제거
- 릿지(Ridge) 함수를 이용하여 모형의 가중치를 제한하고 다항식 차수 감소시킴
- 변수를 변형시키거나 새로운 관측치 이용
- 박스칵스(Box-cox) 변환
- 로그변환과 거듭곱 변환을 모두 포함
- 데이터를 정규분포에 가깝게 만드거나 데이터의 분산을 안정화하는 용도로 사용
- 분산분석(ANOVA : Analysis of Variance)표
- 유의확률(p-value) < 유의수준(α)이면 회귀식이 유의하다고 판정
- 종속변수의 표본분산 : SST/(n-1)
- 기본적인 가정을 토대로 이루어짐
- 독립/종속변수의 선형성
- 오차의 정규성, 등분산성, 독립성
- 결정계수(종속변수의 전체 분산이 회귀식에 의해 설명되는 비율)이 클수록 좋은 회귀 모형
| 요인 |
제곱합 |
자유도 |
제곱평균 |
F |
| 회귀 |
SSR |
1 |
MSR=SSR/1 |
F=MSR/MSE |
| 잔차 |
SSE |
n-2 |
MSE=SSE/(n-2) |
| 전체 |
SST |
n-1 |
- |
- 인공신경망의 하이퍼파라미터
- 하이퍼파라미터 : 학습률, 은닉층의 개수, 배치 크기, 훈련 반복횟수, 손실 함수, 가중치 초기화
- 파라미터 : 가중치, 편향(Bias), 결과값
- 자기 상관 (Auto Correlation)
- 시간 또는 공간적으로 연속된 일련의 시계열 관측값들 사이에 존재하는 상관관계
- 시계열 데이터에서 시차 값 사이의 선형관계 측정 위해 사용됨
- CNN(합성곱 신경망)
- 합성곱 연산
- Feature Map을 이용한 학습
- 로봇 이미지 인식, 컴퓨터 비전, 영상분석 및 인식
- RNN(순환 신경망)
- 노드 간 연결이 순환 구조를 가짐
- 주기 예측 등 순차적 데이터 처리 분야를 활용
- 필기체 텍스트, 음성, 언어 번역
- GAN(생성적 적대 신경망)
- 제로섬(Zero-Sum) 게임 틀 내에서 서로 경쟁하는 신경망 활용
- 가짜 생성 모델에 대한 진위 여부 판별 모델의 경쟁
- 컴퓨터 게임, 패션, 광고
- 강화학습
- 행동심리학에서 영감을 받음
- 마코프 프로세스 결정모델 활용
- 게임, 제어, 정보이론, 다중 에이전트 시스템
- 심층 신뢰 신경망(DBN : Deep Belief Network)
- 다층의 잠재변수로 표현되는 은닉층으로 구성
- 레이블이 없는 데이터에 대한 비지도 학습 방법 이용
- 학습 데이터가 충분하지 않을 때 유용
- RBM(Restricted Boltzman Machine)을 층층이 쌓아 구성
- 부분 이미지에서 전체를 연상시키는 일반화과정 구현
- 글씨 인식, 음성 데이터를 이용한 감성 분석에 활용됨
- 인공신경망에서 사용되는 활성화함수(Activation Function)
- 활성화 함수 : 입력된 가중합을 출력신호로 변환하는 함수
- 은닉층의 수가 많아지면 매개변수의 수를 줄여 필요한 연산의 수 감소
- 시그모이드
- 정의역 : 실수 전체
- 유한한 구간 사이의 한정된 값 변환
- 정의역의 절댓값이 클수록 미분값이 0으로 수렴 ⇒ 가중치 업데이트 X, 기울기 손실 형상 발생
- 딥러닝 심층인공신경망에서 사용되는 경사하강법
- Momentum
- NAG(Nesterov Accelerated Gradient)
- AdaGrad(Adaptive Gradient)
- RMSProp
- AdaDelta
- Adam(Adaptive Momentum Estimation)
- 앙상블(Ensemble) 기법
- 배깅(Bagging) : Bootstrap + Aggregation
- 샘플을 여러번 뽑아 각 모델을 학습시켜 결과물을 집계
- EX) Random Forest
- 부스팅(Boosting)
- 가중치를 활용하여 약 분류기를 강 분류기로 만드는 방법
- AdaBoost, XGBoost, Arc-x4
- 윌콕슨 부호순위 검정
- 두 모집단에 대한 분포의 가정이 어렵거나 표본의 가정이 어렵거나 표본이 순위로밖에 표현될 수 없을 때, 두 모집단의 확률분표가 동일한지에 대한 가설 검정
- 프라이드만(Friedman) 검정
- 동일한 케이스에 대해 반복된 측정이 이어졌을 때 세 개 이상의 집단 비교를 위해 사용되는 비모수 검정 방법
- 4과목
- 평균 절대 백분 오차 비율 (MAPE : Mean Absolute Percentage Error)
- 실제 데이터에서 오차가 어느 정도 비율로 발생했는지 평가하기 위하여 종속변수 값 대비 예측 오차 비율의 절대값을 평균한 값
- 인공 신경망 과적합 방지 방법
- 모델의 복잡도 줄이기 (은닉층 or 매개변수 수 줄이기)
- 가중치 규제
- 드롭아웃 (학습과정에서 신경망의 일부를 사용하지 X)
- 적절한 학습률 유지
-
- 혼동 행렬
- 민감도(Senstivity, Recall) =TP/(TP+FN)
- 정밀도(Precision)=TP/(FP+TP)
| 구분 |
예측 범주값 |
| Yes(참) |
No(거짓) |
| 실제 범주값 |
Yes(챰) |
O (TP : True Positive) |
X (FN : Fale Negative) |
| No(거짓) |
X (FP : False Positive) |
O (TN :True Negative) |