co-code 님의 블로그
co-code
« 2026/08 »
| 일 |
월 |
화 |
수 |
목 |
금 |
토 |
| |
|
|
|
|
|
1 |
| 2 |
3 |
4 |
5 |
6 |
7 |
8 |
| 9 |
10 |
11 |
12 |
13 |
14 |
15 |
| 16 |
17 |
18 |
19 |
20 |
21 |
22 |
| 23 |
24 |
25 |
26 |
27 |
28 |
29 |
| 30 |
31 |
|
|
|
|
|
관리 메뉴
co-code 님의 블로그
제 5회 기출 복원 문제 오답 정리 본문
빅분기 공부
제 5회 기출 복원 문제 오답 정리
co-code
2026. 8. 4. 23:54
- 1과목
- 데이터 직군
- 데이터 분석가
- 데이터를 분석·정리하여 비즈니스 결정 시 도움을 줄 수 있는 데이터 분석 보고서 제작
- 데이터 사이언티스트
- 비즈니스 문제를 정의하고 문제를 해결하기 위한 데이터 분석 모형을 제작
- 데이터 아키텍트
- 조직 내 잠재적인 데이터 소스 평가 후 이를 통합·집중화하고, 보호·관리 계획을 설계하며, 데이터 관리 시스템의 선을을 지속적으로 모니터링하여 보고
- 데이터 엔지니어
- 내부·외부 원천 데이터를 수집·가공·적재하여 데이터의 흐름(파이프라인)을 설계·구축
- CRISP-DM(Cross Industry Standard Process for Data Mining)
- 체계화된 절차와 방법으로서 계층적 데이터 분석 프로세스 모델
- 분석 단계
- 비즈니스 이해 → 데이터 이해 → 데이터 준비 → 모델링 → 평가 → 전개
- 데이터 수집 방법
- 실시간 데이터 : 오픈 API
- 웹 로그 데이터 : Apache Flume, Scribe, Chukwa 등의 Log Collector 이용
- 웹 메타 데이터 : 스크래핑
- 웹 문서 데이터 : 크롤링
- 병렬 DBMS
- 다양한 동작의 병렬 컴퓨팅을 통해 성능을 개선하고 데이터의 중복의 가능성을 낮게 함
- 다중 중앙처리장치와 디스크를 병렬로 사용함으로써 데이터 처리 및 밉출력 속도를 개선
- 데이터 적재, 색인 빌드, 쿼리 평가 등의 다양한 동작의 병렬 컴퓨팅을 통해 성능 개선
- 일반적으로 Massive Parallel Processing 구조이며, 대량의 데이터를 빠르게 적재하고 저장
- 서비스형 인프라스트럭쳐 플랫폼
- 서버, 스토리지, 네트워크를 필요에 따라 인프라 자원을 사용할 수 있도록 클라우드 서비스 제공
- EX)서버 가상화, 데스크톱 가상화 등
- 2과목
- 박스 플롯(Box-Plot)
- 데이터를 탐색하고 시각화하여 패턴을 식별하기 위하여 박스플롯 이용
- 제 1 사분위수는 전체 데이터 중 하위 25%에 해당하는 값
- 제 2 사분위수는 중앙값(Median)과 동일
- 제 3 사분위수는 전체 데이터 중 상위 25%에 해당하는 값
- 클래스 불균형 문제 처리 방법
- 반복 샘플링(Resampling)
- 언더 샘플링(Undersampling)
- 오버 샘플링(Oversampling)
- 데이터 정규화
- 분석 모형 구축 시 학습 값들이 적당한 범위를 유지하도록 모형에 입력할 데이터를 반환하는 작업
- 데이터 분석 모형 구축 시 고려 사항
- 비용 민감학습 : 소수 클래스 데이터에 더 민감하게 학습하도록 더 큰 클래스 가중치 (비용함수) 지정
- 포아송 분포 (Poisson Distribution)
- 확률론에서 단위 시간당 또는 단위 면적(영역) 당 특정 사건의 발생 횟수를 표현하는 이산확률 분포
- 정규성 검정
- 데이터셋의 분포가 정규분포를 따르는 지 검정
- 검정 방법
- 샤피로 윌크 테스트 (Shapiro-wilk Test)
- 콜모고로프-스미르노프 검정(Kolmogorov_smirnov Test) : K-S 검정
- Q-Q 플롯 (Quantile-quantile Plot)
- 카이스퀘어 검정 (Chi-square Test)
- 카이제곱 분포에 기초한 통계적 검정 방법
- 관찰된 빈도가 기대 빈도와 의미 있게 다른 지의 여부를 검정(동질성, 독립성 검정)하기 위해 사용
- 3과목
- 심슨의 역설 (Simpson Paradox)
- 각각의 변수에 신경 쓰지 않고 전체 통계 결과를 유추할 때 일어나는 오류로서 사람들의 직관과 반대되는 역설적인 상황이 발생되는 현상
- 여러 그룹의 자료를 합했을 때의 결과와 각 그룹을 구분했을 때의 결과가 다를 때
- 부분을 단순히 합친 것 뿐인데 그 결과가 각 부분을 비교했을 때의 결과와 달라지는 것
- 과적합(Overfitting) 감소 방안
- 인공 신경망에서
- 드롭 아웃 (Dropout)
- 데이터 학습률 조정
- 은닉층 노드 삭제
- 의사결정나무 분석에서
- 가지치기 (Tree Pruning)
- 의사결정나무에서 과적합을 줄이고 일반화 가능성을 증대시키는 Sub-Tree를 찾는 과정
- 의사결정나무에서 과적합을 방지하기 위해 적절한 수준에서 Terminal Node를 결합해 줌
- 인자 분석 (Factor Analysis)
- 분석 대상의 변수들이 상호 연관성을 가지고 소수의 요인으로 분석되는 경우에 사용되고 해당 요인들을 찾아서 변수를 줄이는 차원 축소 방법
- 상호 연관된 여러개의 변수들 간의 내부적 상호관계를 변수들 간의 내재하는 소수의 잠재적인 관측 불가능한 인자를 추출해내는 다변량 분석 방법
- 인자 분석을 위해 사용되는 공분산 행렬에서의 행, 열의 수는 분석 대상의 변수의 수에 따라 결정됨
- 회귀 분석, 상관분석, 판별 분석에 사용될 적은 수의 변수를 새롭게 만들기 위해서 사용
- 앙상블 분석
- 여러가지 분석 모형을 조합해 정확도가 높은 최종 모형을 만듦
- 단일 분류기보다 신뢰성이 높은 예측값을 도출한다.
- 대표적으로 Voting, Bagging, Boosting 방법 이용
- 최적화 방법
- 여러 개의 데이터 분석 모형을 조화롭게 학습시키기
- 훈련 데이터셋을 무작으로 다른 데이터셋으로 만들어서 결정트리 분류기를 만들고, 많은 모형들 중에서 가장 많은 선택을 받은 클래스를 예측
- 훈련 데이터셋의 중복을 허용하여 샘플링하거나 약한 학습기 여러 개를 서로 연결하고 보완해 가면서 더욱 강한 학습기를 만듦
- 4과목
- ROC(Receiver Operating Curve) 그래프
- 성능 평가 지표들 중 거짓긍정률(1-특이도)과 참긍정률(민감도)을 이용하여 표현한 곡선
- 거짓긍정률과 참긍정률은 혼동행렬로부터 구할 수 있음
- 긍정 범주와 부정 범주를 판단하는 기준치의 변화에 따라 참긍정과 거직긍저으이 비율이 어떻게 변화하고 있는지 파악하기 위해 사용됨
- 과대적합
- 머신러닝에서 자주 발생하며, 데이터 분석모형이 과대적합일 때 일반적으로 분산이 큼
- 차수가 높은 비선형 모형의 경우 학습 데이터에만 너무 맞춘 학습이 이뤄져서 정작 테스트 환경에서 는 오히려 예측 정확도가 떨어짐
- ⇒ 차수가 높을 수록(비선형 모형일수록) 과대적합의 문제가 크게 발생함
- 스토리텔링(Storytelling) 수행 절차
- 사용자별 데이터 세트 및 정의 → 사용자 시나리오 작성 → 스토리보드 기획
- 시각화 방법
- 관계 시각화
- 버블 차트 (Bubble Chart)
- 산점도 (Scatter Plot)
- 히스토그램 (Histogram)
- 비교 시각화
- 체르노프 페이스 (Chernoff Face)
- 히트맵 (Heat Map)
- 스타 차트 (Star Chart)
- 평행 좌표 그래프 (Parallel Coordinate Plot)
- 데이터 분석 결과에 대한 산출물
- 데이터 분석 계획서
- 분석 모형별 예측 결과 보고서
- 효과 검증 프로젝트 결과 보고서 ( or 비즈니스 성과 보고서)
- 분석 모형 유지 보수 가이드