<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>co-code 님의 블로그</title>
    <link>https://co-code.tistory.com/</link>
    <description>co-code 님의 블로그 입니다.</description>
    <language>ko</language>
    <pubDate>Sun, 16 Aug 2026 17:42:40 +0900</pubDate>
    <generator>TISTORY</generator>
    <ttl>100</ttl>
    <managingEditor>co-code</managingEditor>
    <item>
      <title>제 8회 기출 복원 문제 오답 정리</title>
      <link>https://co-code.tistory.com/36</link>
      <description>&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;빅데이터 플랫폼
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다양한 데이터 소스에서 수집된 데이터를 처리하고 분석해서 지식을 추출하고 지능화된 서비스를 제공하는데 필요한 IT 환경&lt;/li&gt;
&lt;li&gt;데이터 수집&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;저장, 데이터 처리, 데이터 분석, 실시간 처리, 데이터 관리를 위한 확장성과 유연성 기능을 제공한다.&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;대표적으로 Apache Hadoop, Spark, AWS의 EMR(Elastic MapReduce), HDinsight 등&amp;nbsp;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;지도학습&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;명확한 목표 변수가 있고, 해당 변수의 자기상관성이 높은 변수들이 있는 경우 적합&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;목표 변수와 특징(Feature)간의 관계를 학습하는데 적합&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;라벨링된 데이터가 있는 경우 이를 기반으로 새로운 데이터에 대한 예측 수행 시 적합&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;목표변수에 대한 중요한 특성이 명확하게 드러나는 경우 적합&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 변환&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 소스에서 추출된 가공된지 않은 데이터를 사용 가능한 데이터세트로 변환하는 작업으로써 데이터 엔지니어링의 핵심 프로세스&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 분할&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터를 배치로 분할하는 작업은 주로 머신러닝 및 딥러닝 모델을 훈련할 때 사용되며, 이 과정은 데ㅣ터를 일정한 크기의 작은 배치(Batch)로 분할하여 모델에 공급하는 것을 의미&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 표준화&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;특정한 형식이나 척도에 맞게 조정하는 과정&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;값의 범위 및 변수의 단위를 조정&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;모델의 성능 향상, 해석의 용이성, 이상치 처리, 알고리즘의 수렴 속도 향상 들을 위해 수행하는 작업&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 비식별화 기법&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;가명 처리 : &lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;식별한 값을 다른 값으로 대체&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;총계 처리&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;범주화&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;마스킹&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;차원 축소&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터세트에 있는 불필요한 정보나 노이즈를 제거하여 데이터를 더 간결하게 만듦&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;계산 비용을 줄이거나 모델의 성능을 향상시킴&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터를 저차원 공간으로 매핑하는 투영(Projection) 방법과 고차원 데이터가 저차원 Manifold에 가깝게 분포되어 있다고 가정하고 매니폴드 학습 기법 이용&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;차원이 높으면(변수가 많으면) 모델의 복잡도가 증가하고 과대적합 문재가 발생할 수 있어 해결하기 위한 방법으로도 사용됨&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;HBase&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Apach Hadoop 프로젝트의 일부로 개발된 분산형 NoSQL 데이터베이스&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;분산형 아키텍처, 스키마 없는 데이터 모델, 비정형 데이터 저장, 고가용성, 빠른 읽기 및 쓰기 성능의 특징을 가지고 있음&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Hadoop MapReduce, Apach Spark 및 다른 하둡 기술과 함께 사용됨&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Key-Value(키-값) 데이터베이스&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;간단하고 유연한 모델을 제공하는 NoSQL의 한 유형&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터는 고유한 키와 해당 키에 연결된 값으로 구성됨&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;구조가 간단하고 높은 확장성, 빠른 읽기 및 쓰기, 유연성, 저렴한 비용의 특성을 가짐&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;단순한 데이터 모델을 가지고 있어 복잡한 쿼리의 수행이 제한됨&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;2과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;데이터 결측값 대체 방법&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;수치형 변수이고 결측값이 무작위로 발생한 경우 평균 또는 중앙값으로 대체하는 것이 유용함&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;자기회귀 모형의 경우 변수 간의 상관성을 고려하여 결측값을 대체하며, 상관성이 낮은 변수들을 사용하는 경우 예측값의 정확성이 낮아지고 모델의 분산이 커짐&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;범주형 변수의 경우 보통 최빈값을 사용하여 결측값 대체&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;수집 데이터의 수가 분석하기에 충분하다면, 결측 데이터를 삭제하는 것도 가능&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;파생변수&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;기존 변수에 특정 조건 또는 함수 등을 이용하여 새롭게 재정의한 변수&lt;/span&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;일반적으로 사전에 정의된 독립변수와 함께 파생변수를 이용하여 종속 변수 예측&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;예측 결과를 이용하여 파생변수를 생성하지는 않음&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;박스칵스(Box-Cox) 변환&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;데이터를 정규분포에 가깝게 만들거나 데이터의 분산을 안정화하는 용도로 사용됨&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;정규성을 가정하는 분석이나 정상성을 요구하는 분석 방법을 적용하기에 앞서 데이터 전처리에 유용하게 사용됨&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;EM(Expectation-Maximization) 알고리즘
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;데이터 결측치나 숨겨진 변수가 있는 모델에 대한 파라미터 수정 기법&lt;/li&gt;
&lt;li&gt;데이터의 관찰된 부분과 관찰되지 않은 부분의 결합확률을 최대화하여 모델의 파라미터 추정&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Metropolis-Hastings 알고리즘
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Markov Chain Monte Carlo 기법 중 하나&lt;/li&gt;
&lt;li&gt;확률분포를 따르는 샘플을 생성하는 목적으로 사용됨&lt;/li&gt;
&lt;li&gt;베이지안 통계에서 모수의 사후 분포를 추정하거나 복잡한 확률모형의 표본을 생성하는 데 이용됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;3과목&amp;nbsp;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;하향식 접근 방법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;해결해야할 문제를 알고 세부 내용을 정의하면서 분석 방법을 알고 최적화하는 기법&lt;/li&gt;
&lt;li&gt;최적화 및 솔루션 기법에 해당됨&lt;/li&gt;
&lt;li&gt;진행 절차
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;문제 정의 : 도메인 및 비즈니스 문제를 데이터의 문제로 변환하여 저장&lt;/li&gt;
&lt;li&gt;해결방안 탐색 : 분석 역량(Who)과 기법(How)으로 분석 문제를 해결하기 위한 다양한 방안을 모색&lt;/li&gt;
&lt;li&gt;타당성 검토 : 경제성과 함께 데이터 및 기술적 타당성 등 다각적인 분석 수행&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;다중공선성
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;회귀 분석에서 발생
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;독립변수들 간의 높은 상관관계가 있는 경우&lt;/li&gt;
&lt;li&gt;독립변수들이 서로 다른 단위나 스케일을 가지는 경우&lt;/li&gt;
&lt;li&gt;일부가 다른 독립변수의 선형 조합으로 나타낼 수 있는 경우&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;선형 회귀 분석 vs 로지스틱 회귀 분석
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;선형회귀 분석
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;LSE(Least Squares Estimation)방법으로 모델의 개수를 추정하면 그 추정량은 불편추정량&lt;/li&gt;
&lt;li&gt;잔차의 정규성을 가정함&lt;/li&gt;
&lt;li&gt;MLE(Maximization Likelihood Estimation)방법으로 모델의 계수 추정이 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;로지스틱 회귀 분석
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;종속변수가 범주형인 경우 (이항 or 다항 분포를 따르는 경우) 사용&lt;/li&gt;
&lt;li&gt;잔차의 정규성 가정 X&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;MLE(Maximization Likelihood Estimation)방법으로 모델의 계수 추정이 가능&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;의사결정나무 분석&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;데이터의 특징에 따라서 순차적으로 분할된 결정 노드와 종단 노드로 이루어진 트리를 생성하며, 각 결정 노드는 특정한 특징의 값을 기준으로 데이터를 분할(해당 노드의 순도(동질성)를 최대화하는 방향으로 분할)하며, 종단 노드는 최종적으로 데이터를 분류하거나 예측하는 역할 수행&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;특징의 스케일 조정이나 정규화 필요 X&lt;/li&gt;
&lt;li&gt;데이터 분할 과정에서 하나의 변수가 다른 변수에 영향을 미치는 변수들 사이의 교호작용을 고려하여 분할 기준 결정&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Seq2Seq
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Seq2Seq 모델에서 인코더를 통해 생성되는 것은 컨텍스트 벡터&lt;/li&gt;
&lt;li&gt;생성된 컨텍스트 벡터는 디코더에 의해 사용되어 출력 시퀀스를 생성하는 데 중요한 역할을 함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;확률적 경사하강법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;학습 속도를 향상시키고 메모리 요구량을 줄이기 위해 각 학습단계에서 전체 데이터세트 대신 선택된 하나의 데이터 포인트를 이용하여 기울기 계산&lt;/li&gt;
&lt;li&gt;AdaGrad(Adaptive Gradient) : 학습률을 동적으로 조정(스텝 크기를 다르게 설정)하여 수렴 속도를 향상시킴&lt;/li&gt;
&lt;li&gt;Momentum : 이전 스텝에서의 기울기 업데이터 값을 고려하여 현재 스텝에서의 기울기 업데이트 값 조정&lt;/li&gt;
&lt;li&gt;Adam(Adaptive Moment Estimation)
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;Momentum + RMSprop&lt;/li&gt;
&lt;li&gt;각 매개변수마다 적응적으로 학습률 조정&lt;/li&gt;
&lt;li&gt;이전의 그래디언트 업데이트와 그 제곱값의 이동평균을 이용하여 매개변수를 업데이트함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;앙상블 모델&amp;nbsp;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;여러 개의 기본 모델을 결합하여 강력한 예측 모델을 생성하는 기법&lt;/li&gt;
&lt;li&gt;단일 모델보다 성능이 항상 우수한 것은 아님 (∵과적합)&lt;/li&gt;
&lt;li&gt;랜덤포레스트
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;결정 트리의 장점을 취합한 모델로, 과적합을 줄이는 데 도움을 줌&lt;/li&gt;
&lt;li&gt;모델에서 트리의 깊이가 깊고 많은 수의 트리가 사용되는 경우 메모리 사용량이 증가&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;4과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;분산 분석
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;두개 이상의 집단 간 비교를 수행하고자 할 때 집단 내의 분산, 총 평균과 각 집단의 평균 차이에 의해 생긴 집단 간 분산 비교로 얻은 F-분포로 가설 검정 수행&lt;/li&gt;
&lt;li&gt;하나의 종속변수를 가지고 여러 개의 그룹 간의 차이를 비교하는 데 사용됨&lt;/li&gt;
&lt;li&gt;다변량 분산 분석
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;여러 개의 종속 변수를 가지고 여러 개의 그룹 간의 평균 차이를 비교&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;피어슨 VS 스피어만 상관걔수
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;피어슨 상관계수 : 두 변수가 모두 연속형인 경우 사용&lt;/li&gt;
&lt;li&gt;스피어만 상관계수 : 순위형 자료 등 서열 척도 자료인 경우 사용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Ben Fry가 정의한 데이터 시각화 7단계 프로세스
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;Acquire (획득)&lt;/li&gt;
&lt;li&gt;Parse (구조화)&lt;/li&gt;
&lt;li&gt;Filter (선별)&lt;/li&gt;
&lt;li&gt;Mine (마이닝)&lt;/li&gt;
&lt;li&gt;Represent (표현)&lt;/li&gt;
&lt;li&gt;Refine (정제)&lt;/li&gt;
&lt;li&gt;Interact (상호작용)&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;li&gt;데이터 분석 활용 계획
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;프로젝트 수행 초기 단계에서 수행&lt;/li&gt;
&lt;li&gt;비즈니스 목표를 달성하기 위한 데이터 분석의 경우 비즈니스 목표와의 연계성 고려&lt;/li&gt;
&lt;li&gt;데이터 분석결과를 활용할 이해관계자들의 요구사항 고려&lt;/li&gt;
&lt;li&gt;데이터 분석결과의 품질을 관리하고 모니터링하는 방법 고려&lt;/li&gt;
&lt;li&gt;절차&amp;nbsp;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;목표 설정&lt;/li&gt;
&lt;li&gt;현재 상태 파악&lt;/li&gt;
&lt;li&gt;분석 도구 및 기술 결정&lt;/li&gt;
&lt;li&gt;데이터 수집 및 전처리&lt;/li&gt;
&lt;li&gt;분석 방법론 선택&lt;/li&gt;
&lt;li&gt;모델 구축 및 평가&lt;/li&gt;
&lt;li&gt;결과 해석 및 시각화&lt;/li&gt;
&lt;li&gt;지속적 개선&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>빅분기 공부</category>
      <category>데이터 분석가 부트캠프</category>
      <category>멀티캠퍼스 부트캠프</category>
      <category>부트캠프</category>
      <category>빅데이터 분석기사</category>
      <category>자격증</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/36</guid>
      <comments>https://co-code.tistory.com/36#entry36comment</comments>
      <pubDate>Thu, 13 Aug 2026 23:30:24 +0900</pubDate>
    </item>
    <item>
      <title>제 7회 기출 복원 문제 오답 정리</title>
      <link>https://co-code.tistory.com/35</link>
      <description>&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;빅데이터 분석 플랫폼
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;빅데이터를 처리하는 과정에서 발생하는 컴퓨팅, 저장, 네트워크 부하를 기술적인 요소로 해결하기 위해 설계됨&lt;/li&gt;
&lt;li&gt;소프트웨어 계층, 플랫폼 계층, 인프라스트럭쳐 계층으로 구성됨
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;소프트웨어 계층 - 데이터 처리, 분석, 수집, 정제 기능 수행&lt;/li&gt;
&lt;li&gt;플랫폼 계층 - 작업 스케쥴링, 자원할당 및 관리, 프로파일링 기능 수행&lt;/li&gt;
&lt;li&gt;인프라스트럭쳐 계층&amp;nbsp;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;사용자 요청 파싱, 자원 배치, 노드 관리, 스토리지 관리, 네트워크 관리, 서비스 관리, 모니터링, 보안 모듈이 포함됨&lt;/li&gt;
&lt;li&gt;빅데이터 처리 및 분석에 필요한 자원 제공&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;빅데이터 분석 기획의 주요 업무
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;빅데이터 분석 결과의 도출 및 관리를 위한 사전 계획 수립&lt;/li&gt;
&lt;li&gt;빅데이터 분석 수행 시 필요한 가용 데이터를 확인하고, 발생할 수 있는 장애 요인에 대처하기 위한 사전 계획 수립&lt;/li&gt;
&lt;li&gt;빅데이터 분석을 통해 그 가치가 창출될 수 있는 실용적이고 적절한 활용 방안과 Use Case 탐색&lt;/li&gt;
&lt;li&gt;(상세 알고리즘 설계는 빅데이터 분석 기획 업무 수행 후 데이터 마이닝/데이터 분석 모델 구축 업무에서 수행)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;반정형 데이터 (Semi-Structured Data)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;데이터의 형식과 구조가 변경될 수 있는 데이터&lt;/li&gt;
&lt;li&gt;구조 정보와 함께 제공하는 파일 형식의 데이터&lt;/li&gt;
&lt;li&gt;HTML, XML, RDF(Resource Description Framework), JSON 등&lt;/li&gt;
&lt;li&gt;정형 데이터에 비해 확장이 더 유연하고 간단함&lt;/li&gt;
&lt;li&gt;기존 방식으로 캡쳐되거나 형식이 지정되어 있지 않음&lt;/li&gt;
&lt;li&gt;원시 또는 비정형 상태가 아니며, 태그 조직 메타 데이터와 같은 일부 구조적 요소가 내제되어 있음&lt;/li&gt;
&lt;li&gt;고정된 스키마가 없어 테이블 형식이나 관계형 데이터 베이스의 형식을 따르지 않음&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;정형 데이터 품질 검증 방법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;업무 규칙
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;업무와 관련된 모든 데이터의 규칙&lt;/li&gt;
&lt;li&gt;조직에서 데이터 품질을 지속적으로 관리하기 위해 사용하는 데이터 규칙&lt;/li&gt;
&lt;li&gt;데이터 값이 정확하기 위한 조건 표현&lt;/li&gt;
&lt;li&gt;데이터 관리 문서에 명시된 데이터 규칙, 업무 담당자가 지식으로 알고 있는 규칙, 응용 프로그램에 코딩된 규칙 등의 산재되어 분산관리되고 있는 규칙을 통합한 것&lt;/li&gt;
&lt;li&gt;조직 내부에서 운영하고 있는 정보 시스템의 품질을 지속적으로 관리하기 위해 활용됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Data Profiling 기법
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;데이터 소스에 대해 일련의 데이터 검사 절차를 수행함으로써, 데이터에 관한 중요한 정보와 통계치를 수집하는 작업&lt;/li&gt;
&lt;li&gt;누락 값, 값의 허용범위, 허용 값 목록, 문자열 패턴, 날짜 유형, 유일값, 데이터 구조, 기타 도메인 분석 작업 필요&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Meta Data 수집
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;프로파일링을 수행하기 이전 단계에서 수행되며, 데이터의 부정확성을 판단하는데 중요한 기초 자료가 됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;HDFS (Hadoop Distributed File System, 하둡 분산 파일 시스템)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;하둡이 실행하는 파일 관리 시스템&lt;/li&gt;
&lt;li&gt;대용량 데이터 처리, 용량 확장성, 높은 처리량, 슬레이브 노드(데이터 노드)의 데이터 손실 방지 기능 제공&lt;/li&gt;
&lt;li&gt;마스터 노드인 네임 노드(2개 이상으로 구성, 메타 데이터)와 슬레이브 노드인 데이터 노드(블록 형태의 파일)로 구성&lt;/li&gt;
&lt;li&gt;네임 노드가 정상적으로 작용하지 않으면, 전체 시스템이 중단됨&lt;/li&gt;
&lt;li&gt;데이터 블록 단위로 나눠서 저장
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;블록 단위가 256MB일 때, 1GB 파일은 4개의 블록으로 나누어 저장됨&lt;/li&gt;
&lt;li&gt;10MB 파일은 하나의 블록으로 저장됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;2과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;이상치 판단 방법 (독립변수 2개, 종속변수 1개일 경우)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;데이터 히스토그램을 그려서 극단적으로 높거나 낮은 값을 이상치로 판단&lt;/li&gt;
&lt;li&gt;데이터 값이 평균에서 얼마나 표준편차만큼 떨어져 있는지를 측정(Z-Score)하여 이상값을 판단&lt;/li&gt;
&lt;li&gt;박스플롯에서 사분위수 범위를 이용하여 시각적으로 이상치를 판단&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;SVD (특이값 분해)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;행렬을 특정한 구조(3개 요소, 2개의 직교행렬과 특이값(0이 아닌 대각 원소값)을 가지는 행렬)로 분해하는 방법&lt;/li&gt;
&lt;li&gt;데이터 축소, 최소제곱해 문제, 영상 처리 및 압축, 군집 개수 결정, 이상치 감지, 잡음 제거, 경향 분석 등에 사용됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;원-핫 인코딩 (One-hot Encoding)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;표현하고 싶은 범주형 변수의 인덱스에 1, 다른 인덱스에는 0을 부여하는 벡터 표현 방식&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;명목형(혹은 범주형) 자료 요약시 사용하는 그래프
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;파레토 차트 (Pareto Chart)&lt;/li&gt;
&lt;li&gt;선 그래프 (Line Chart)&lt;/li&gt;
&lt;li&gt;점 그래프 (Dot Plot)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;히스토그램(Histogram)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;연속형 변수의 값 또는 분포 형태를 나타내기 위해 사용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;공분산 이용한 상관계수 공식
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;X, Y의 상관계수 = X, Y의 공분산 / (X의 표준편차 &amp;times; Y의 표준편차)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;최빈값
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;관측값에서 빈도가 가장 많은 값&lt;/li&gt;
&lt;li&gt;범주형 자료의 대푯값으로 주로 이용됨&lt;/li&gt;
&lt;li&gt;자료에서 도수가 가장 큰 값이 한 개 이상 있으면 그 값이 모두 최빈값임&lt;/li&gt;
&lt;li&gt;이상값에 큰 영향 받지 X&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;데이터의 중심 위치(중심 경향값, Central Tendency)를 나타내는 기술 통계량
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;평균&lt;/li&gt;
&lt;li&gt;중앙값&lt;/li&gt;
&lt;li&gt;최빈값&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;데이터의 흩어짐 정도(분포)를 나타내는 기술 통계량
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;분산&lt;/li&gt;
&lt;li&gt;표준편차&lt;/li&gt;
&lt;li&gt;범위&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;중심극한정리(CLT, Central Limit Theorm)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;동일한 확률 분포를 가진 확률 변수 n(보통 30 이상)개의 평균의 분포는 정규분포에 가까워짐&lt;/li&gt;
&lt;li&gt;모집단의 분포에 대한 어떤 정보 없이 평균, 표준편차만 알고 있더라도 표본 평균의 분포를 점근적으로 알 수 있음
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;여기서 모집단은 임의의 모집단&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;3과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;계층적 군집 분석
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;사전에 군집의 개수를 지정할 필요 X&lt;/li&gt;
&lt;li&gt;주로 자료의 크기가 작은 경우&lt;/li&gt;
&lt;li&gt;개별 대상들 사이의 거리에 의해 가장 가까이에 있는 대상들로부터 결합해 군집 형성&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Transformer
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;(Self) Attention 매커니즘이 적용된 딥러닝 모델
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;주요 기능
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Input/Output Emb=edding&lt;/li&gt;
&lt;li&gt;Positional Encoding&lt;/li&gt;
&lt;li&gt;Multi-head Attention&lt;/li&gt;
&lt;li&gt;Feed Forward&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;LSTM(Long Short Term Memory)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;RNN 개선&lt;/li&gt;
&lt;li&gt;Forget/Input/Output Gate 이용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;비정형 데이터 분석을 위해 사용되는 언어 모델(Language Model)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Bidirectional Encoder Representations for Transformers(BERT)&lt;/li&gt;
&lt;li&gt;Latent Semantic Analysis&lt;/li&gt;
&lt;li&gt;N-gram&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;YOLO (You Only Look Once)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;최점단 실시간 Object Detection 시스템&lt;/li&gt;
&lt;li&gt;물체 감지와 객체 인식에 대한 딥러닝 기반 접근 방식을 사용하여 빠르고 정확한 데이터 처리 속도(실시간 의사결정에 우수한 성능 O)를 나타냄&lt;/li&gt;
&lt;li&gt;입력된 이미지를 일정 분할로 그리드 작업 후, 신경망을 통과하여 Bounding Box와 Class 예측을 생성하여 최종 감지 출력을 결정함&lt;/li&gt;
&lt;li&gt;실제 이미지와 비디오에서 사전에 먼저 데이터셋에 대한 여러 인스턴스들을 학습함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;4과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;신뢰구간&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모집단의 표준편차를 알고 있는 경우 또는 표본의 크기가 큰 경우 모평균의 신뢰구간의 표준정규분포 이용&lt;/li&gt;
&lt;li&gt;표준편차를 모르고 표본의 크기가 작으면, 자유도가 n-1인 t-분포 이용&lt;/li&gt;
&lt;li&gt;모분산 및 모표준편차에 대한 신뢰구간은 카이제곱(자유도=n-1) 분포 이용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;정준상관분석(CCA, Canonical Correlation Analysis)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;두개 이상의 집단의 연관성(상관관계)을 확인하기 위해 사용됨&lt;/li&gt;
&lt;li&gt;두 변수 집단의 상관성을 구하기 위해 상관계수 이용&lt;/li&gt;
&lt;li&gt;상관분석과 회귀 분석이 결합 확장된 분석방법&lt;/li&gt;
&lt;li&gt;두 변수 집단 (X₁, X₂)와 (Y₁, Y₂, Y₃)사이의 선형 결합 변수를 각각 W, V라고 할 때, 정준상관계수는 변수 W와 V의 상관계수를 구하여 분석함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;머신러닝 기반 데이터 분석 모형의 성능 평가
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;학습 데이터가 적고 분석 모형이 복잡한 경우 과대 적합(Overfitting)의 위험이 높아짐&lt;/li&gt;
&lt;li&gt;데이터 분석 모형의 성능을 높이기 위해 일반적으로 학습, 검증 데이터를 이용하여 하이퍼 파라미터를 최적화함&lt;/li&gt;
&lt;li&gt;데이터 분석 모형의 복잡한 경우 학습 데이터의 수준을 높여 과적합 방지, 모형 성능 향상, 일반화 능력 향상, 신뢰성 있는 평가를 받도록 해야 함&lt;/li&gt;
&lt;li&gt;어떤 시점에서는 추가 데이터의 수가 모형의 성능에 큰 영향을 미치지 않아 데이터의 수가 많아질수록 항상 모형의 성능이 향상되는 것은 아님&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>빅분기 공부</category>
      <category>데이터 분석가 부트캠프</category>
      <category>멀티캠퍼스 부트캠프</category>
      <category>부트캠프</category>
      <category>빅데이터 분석기사</category>
      <category>자격증</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/35</guid>
      <comments>https://co-code.tistory.com/35#entry35comment</comments>
      <pubDate>Mon, 10 Aug 2026 23:52:13 +0900</pubDate>
    </item>
    <item>
      <title>멀티캠퍼스 KDT 데이터 분석가 최종 프로젝트 6차 수행일지</title>
      <link>https://co-code.tistory.com/34</link>
      <description>&lt;p&gt;&lt;figure class=&quot;fileblock&quot; data-ke-align=&quot;alignCenter&quot;&gt;&lt;a href=&quot;https://blog.kakaocdn.net/dn/NRAiU/dJMcajpAee6/xtCz2IjbhmKr4s5GTRIYsK/%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8_%EC%88%98%ED%96%89%EC%9D%BC%EC%A7%80_%280803%7E0807%29.docx?attach=1&amp;amp;knm=tfile.docx&quot; class=&quot;&quot;&gt;
    &lt;div class=&quot;image&quot;&gt;&lt;/div&gt;
    &lt;div class=&quot;desc&quot;&gt;&lt;div class=&quot;filename&quot;&gt;&lt;span class=&quot;name&quot;&gt;프로젝트_수행일지_(0803~0807).docx&lt;/span&gt;&lt;/div&gt;
&lt;div class=&quot;size&quot;&gt;0.04MB&lt;/div&gt;
&lt;/div&gt;
  &lt;/a&gt;&lt;/figure&gt;
&lt;/p&gt;</description>
      <category>데이터 분석 프로젝트</category>
      <category>데이터분석</category>
      <category>데이터분석가</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/34</guid>
      <comments>https://co-code.tistory.com/34#entry34comment</comments>
      <pubDate>Sun, 9 Aug 2026 13:02:28 +0900</pubDate>
    </item>
    <item>
      <title>제 6회 기출 복원 문제 오답 정리</title>
      <link>https://co-code.tistory.com/33</link>
      <description>&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;빅데이터 분석 조직 구조
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;집중 구조
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;전담 조직에서 분석 업무를 담당하여 우선 순위의 업무를 수행할 수 있으나 타 부서와의 업무 중복 및 이원화 가능성이 높음&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;기능 구조
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;각 해당 부서에서 업무를 수행하며, 과거에 국한된 분석 수행 가능성이 높고 전사적인 핵심 분석이 어렵음&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;분석 구조
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;분석 인력을 현업 부서에 배치하여 전사적 차원의 우선순위 업무를 수행함으로써 빠른 피드백 및 모범 사례의 공유가 가능하나 부서별 역할분담을 사전에 명확하게 설정하여야 함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;NCS에서 정의한 빅데이터 분석 업무 기획 단계
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;도메인 이슈 도출 : 대상 과제의 현황을 파악하고 개선과제를 정의하는 빅데이터 요건 정의서 수립&lt;/li&gt;
&lt;li&gt;분석 목표 수립 : 빅데이터 분석을 통해 얻고자 하는 목표를 정의한 분석 목표 정의서 수립&lt;/li&gt;
&lt;li&gt;프로젝트 계획 : 빅데이터 분석을 위한 예산, 소요기간, 현재의 IT 환경 등을 고려하여 WBS 설계&lt;/li&gt;
&lt;li&gt;보유 데이터 자산 확인 : 분석 목표와 프로젝트 계획에 따른 사전 데이터 점검 (데이터 품질, 분량, 수집 경로)&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;li&gt;분석 준비도(Readiness) 진단 위한 평가 영역
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;분석 업무 파악 : 예측 분석, 시뮬레이션 분석, 최적화 분석 업무 등&lt;/li&gt;
&lt;li&gt;분석 인력&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;조직 : 전문가 직무, 교육 훈련 프로그램, 관리자 능력, 전사 총괄 조직, 경영진 이해 등&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;분석 기법 : 분석 기법 라이브러리, 효과성 평가, 정기적 개선 등&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;분석 데이터 : 데이터 확보, 비구조적 데이터 관리, 외부 데이터 활용 체계, 기준 데이터 관리&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;분석 문화 : 의사결정 구조, 관리자 데이터 중시, 데이터 활용, 데이터 공유 및 협업 문화 등&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;IT 인프라 : 데이터 통합, 데이터 유통 체계, 전용 서버 및 스토리지 확보, 분석 환경 등&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 전처리 작업&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 정제 (Data Cleansing)&lt;/span&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;수집 데이터의 불일치성을 교정하기 위한 과정으로 결측값 처리, 이상치 및 잡음(3&amp;times;표준편차보다 큰 값) 제거 업무&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 유형 변환 (Data Type Transformation)&lt;/span&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터를 분석 목적에 맞게 하고 분석이 용이한 형태로 변하는 작업&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 저장 시스템&lt;/span&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 웨어하우스&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;사용자의 의사결정에 도움을 주기 위하여 기간 시스템의 데이터 베이스에 축적된 데이터를 공통의 형식으로 변환해서 관리하는 데이터베이스&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 마트&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 웨어하우스의 좀 더 경량화된 형태&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;전사적으로 운영되는 데이터 웨어하우스와 다르게 본부별, 부서별, 또는 업무 영역별로 구성이 되는 소규모 데이터 웨어하우스&amp;nbsp;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 소매점(데이터 마트)에는 데이터를 공급하는 데이터 도매점(데이터 웨어하우스)이 있음&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 레이크&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 마트와 달리 데이터를 더 많이 모으기 위해 등장한 개념&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;다양한 종류의 데이터를 모으는 관점에서 고안된 개념&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 댐&lt;/span&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;여러 곳에서 생산되는 데이터를 수집, 분류, 가공해 누구나 쉽게 인공지능과 네트워크를 결합해 쓸 수 있도록 공급하는 시스템 개념&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;2과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;데이터 전/후 처리
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;데이터 전처리 : 필터링, 유형변환, 정제 등&lt;/li&gt;
&lt;li&gt;데이터 후처리 : 변환, 통합, 축소 등&lt;/li&gt;
&lt;li&gt;절차 : 분석 대상의 데이터 수집&amp;nbsp;&amp;rarr; 데이터 전/후처리&amp;nbsp;&amp;rarr; 데이터베이스에 적재&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Map Reduce의 디자인 패턴(Design Pattern)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;요약 패턴 : 데이터 요약, 그룹핑, 최상위 수준의 요약 결과 확인&lt;/li&gt;
&lt;li&gt;필터링 패턴 : 데이터 Subset 및 특정 사용자 생성 Record 확인&lt;/li&gt;
&lt;li&gt;데이터 조직화 패턴 : 타 시스템 작업, 맵리듀스 분석, 데이터 조직화 처리&lt;/li&gt;
&lt;li&gt;조인 패턴 : 데이터들 사이의 특별한 관계를 발견하기 위해 데이터세트를 함께 분석할 수 있는 해법 제공&amp;nbsp;&lt;/li&gt;
&lt;li&gt;메타 패턴 : 여러 문제 동시 해결 동일 Job으로 여러 분석 수행을 위한 패턴 조합&lt;/li&gt;
&lt;li&gt;입출력 패턴 : 데이터 적재, 저장을 위한 하둡 시스템 Customizing&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;이상값(Outlier) 처리
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이상값
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;관측된 데이터의 범위에서 많이 벗어난 아주 작은 값이나 아주 큰 값&lt;/li&gt;
&lt;li&gt;의사 결정에 큰 영향을 미칠 수 있어 데이터 전처리 과정에서 적절한 처리가 필수적&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;이상값 처리 위해 박스플롯을 사용하는 경우 사분위수 범위 값을 이용하여 탐지할 수 있음&lt;/li&gt;
&lt;li&gt;분석의 목적이나 종류에 따라 이상값을 제거하거나 대체&lt;/li&gt;
&lt;li&gt;이상값 대체 위해 평균, 최빈값, 중앙값, 예측값 등 이용
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;이상값을 이 값들로 치환하더라도 데이터 변환 시 신뢰도 문제는 발생함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;원-핫 인코딩(One-hot Encoding)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;표현하고 싶은 범주형 변수의 인덱스에 1, 다른 인덱스에는 0을 부여하는 벡터 표현 방식&lt;/li&gt;
&lt;li&gt;장점 : 구현이 쉽고 작은 데이터셋에서 빠르게 동작&lt;/li&gt;
&lt;li&gt;단점
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;범주가 추가되면 데이터 크기가 바뀌게 됨&lt;/li&gt;
&lt;li&gt;정보가 없는 공간에선도 관리가 필요함&lt;/li&gt;
&lt;li&gt;메모리의 낭비 발생&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;3과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;다중선형회귀분석
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;여러 개의 독립변수(연속형)와 하나의 종속변수(연속형)의 선형관계를 모델링하기 위해 사용됨&lt;/li&gt;
&lt;li&gt;각각의 독립변수는 종속변수와 성형관계가 존재함&lt;/li&gt;
&lt;li&gt;독립변수 사이는 높은 수준의 상관관계가 존재하지 않아야 함&lt;/li&gt;
&lt;li&gt;추정된 종속변수 값과 실제 관측된 종속변수 값과의 차이(잔차)는 정규분포를 따라야 함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;결정계수(Coefficient of Determination, R&amp;sup2;)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1에 가까울수록 산점도에서 점들이 직선 주위에 밀집되어 나타나게 되어, 회귀에 대한 설명이 잘 됨을 의미&lt;/li&gt;
&lt;li&gt;독립 변수와 관계 없음&lt;/li&gt;
&lt;li&gt;총편차 제곱식을 활용하여 구축된 회귀분석 모형의 정확도를 평가하기 위해 사용됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;인과관계 분석 (Causal Analysis)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;인과관계 :&amp;nbsp; 선행하는 한 변수가 후 행하는 다른 변수의 윈인이 되는 관계&lt;/li&gt;
&lt;li&gt;독립변수와 종속변수 사이의 인과관계를 분석&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;의사결정나무 분석&amp;nbsp; 알고리즘
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;CHAID
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;카이제곱(이산형 목표변수)이나 F검정(연속형 목표변수)를 이용해서 분리를 수행하는 알고리즘&lt;/li&gt;
&lt;li&gt;카이제곱 통계량이 가장 큰 예측변수를 이용해서 자식마디 형성&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;CART
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;지니지수(Gini Index)를 이용해서 분리를 수행하는 알고리즘
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;지니지수&amp;nbsp;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;0에서 1사이의 값&lt;/li&gt;
&lt;li&gt;1은 완벽한 순수의 노드&lt;/li&gt;
&lt;li&gt;각 마디에서의 불순도나 다양도 측정&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;C4.5
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;엔트로피 지수(Entropy Index)를 이용하여 분리 및 가지치기 수행&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Alpha-Beta 가지치기
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;사전에 가능성이 없는 경우 가지를 미리 제거하는 방법&lt;/li&gt;
&lt;li&gt;사전에 쓸모 없는 가능성을 제거하면서 시간과 공간의 낭비를 줄임&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;랜덤포레스트
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;배깅 기법을 이용해 개별 의사결정 트리가 데이터 집합에서 무작위로 표본을 추출하고 데이터를 대체하여 개별 트리엣 다른 결과를 생성
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;이 경우 각각의 트리는 사용가능한 모든 데이터를 포함하는 대신 데이터의 일부만 사용함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;결측치 다루기에 용이함&lt;/li&gt;
&lt;li&gt;데이터 처리에 효과적이고 모델의 정확도를 향상시킬 수 있으나, 학습을 위한 메모리 소모가 큼&lt;/li&gt;
&lt;li&gt;분류, 회귀 분석 등에 사용되는 앙상블 학습 방법의 일종&lt;/li&gt;
&lt;li&gt;훈련과정에서 구성한 다수의 결정 트리로부터 분류 또는 평균 예측치를 출력함&lt;/li&gt;
&lt;li&gt;의사결정나무 기법에서의 오버피팅 한계를 극복하기 위한 하나의 전략으로 제시됨&lt;/li&gt;
&lt;li&gt;훈련을 통해 구성한 다수의 나무들로부터 최종적인 결과를 취합하여 결론 도출&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;4과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;ROC - 민감도(p) vs 특이도(c)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;예측력이 있는 데이터 분석모형의 경우 : 민감도(p) &amp;gt; 1-특이도(1-c)&lt;/li&gt;
&lt;li&gt;예측력이 없는 데이터 분석모형의 경우 : 민감도(p)=1-특이도(1-c)&lt;/li&gt;
&lt;li&gt;민감도가 증가하면 특이도 감소&lt;/li&gt;
&lt;li&gt;특이도가 증가하면 민감도 감소&lt;/li&gt;
&lt;li&gt;특이도(c) = 0.5 &amp;rarr; 민감도(p) &amp;gt; 0.5&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;SERVQUAL(Service Quality, 서브퀄) 기반 서비스 품질관리 평가지표
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 항목에 대한 기준을 세우고 고객의 기대와 서비스 인지에 대한 서비스 인지에 대한 서비스 품질을 관리함
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;유형성 (물리적인 시설)&lt;/li&gt;
&lt;li&gt;신뢰성 (고객에게 약속한 서비스 준수 여부)&lt;/li&gt;
&lt;li&gt;대응성 (즉각적 응대 및 신속한 서비스 제공)&lt;/li&gt;
&lt;li&gt;확신성 (전문지식, 기술, 자격 등의 능력)&lt;/li&gt;
&lt;li&gt;공감성 (고객에 대한 배려, 관심, 맞춤형 서비스 제공 여부)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;비교 시각화
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;비교 대상의 변수가 둘 이상인 경우 변숫값을 비교하며, 변수들 사이의 관계를 이해하기 위해 사용&lt;/li&gt;
&lt;li&gt;스타차트(Star Chart)
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;각 변수의 표시 지점을 연결선을 통해 그려 별 모양으로 나타냄&lt;/li&gt;
&lt;li&gt;중심점은 축이 나타내는 값의 최솟값, 가장 먼 끝점은 최댓값&lt;/li&gt;
&lt;li&gt;독립변수가 늘어날 때마다 축이 늘어나는 비교시각화 방법&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;체르노프 페이스 (Cherrnoff Face)
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;데이터를 사람의 얼굴 이미지로 표현&lt;/li&gt;
&lt;li&gt;얼굴의 가로 너비, 세로 높이, 눈, 코, 입, 귀 등 각 부위를 변수로 대체해 데이터 속성을 쉽게 파악 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;평행 좌표계
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;여러 축을 평행으로 배치하여 만듦&lt;/li&gt;
&lt;li&gt;y축에서 윗부분은 최대값, 아래는 최솟값&lt;/li&gt;
&lt;li&gt;대상이 많은 데이터에 대한 집단적 경향성 파악 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;히트맵
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;색상으로 데이터 값을 표현&lt;/li&gt;
&lt;li&gt;하나의 대상에 해당하는 하나의 행을 왼쪽에서 오른쪽(또는 하나의 열을 위에서 아래로)으로&amp;nbsp; 보면서 모든 변수 파악 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>빅분기 공부</category>
      <category>데이터 분석가 부트캠프</category>
      <category>데이터 분석기사</category>
      <category>멀티캠퍼스 부트캠프</category>
      <category>부트캠프</category>
      <category>자격증</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/33</guid>
      <comments>https://co-code.tistory.com/33#entry33comment</comments>
      <pubDate>Sat, 8 Aug 2026 16:40:27 +0900</pubDate>
    </item>
    <item>
      <title>제 5회 기출 복원 문제 오답 정리</title>
      <link>https://co-code.tistory.com/32</link>
      <description>&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;데이터 직군
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;데이터 분석가
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;데이터를 분석&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;정리하여 비즈니스 결정 시 도움을 줄 수 있는 데이터 분석 보고서 제작&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;데이터 사이언티스트
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;비즈니스 문제를 정의하고 문제를 해결하기 위한 데이터 분석 모형을 제작&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;데이터 아키텍트
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;조직 내 잠재적인 데이터 소스 평가 후 이를 통합&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;집중화하고, 보호&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;관리 계획을 설계하며, 데이터 관리 시스템의 선을을 지속적으로 모니터링하여 보고&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;데이터 엔지니어
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;내부&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;외부 원천 데이터를 수집&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;가공&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;적재하여 데이터의 흐름(파이프라인)을 설계&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;구축&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;CRISP-DM(Cross Industry Standard Process for Data Mining) &lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;체계화된 절차와 방법으로서 계층적 데이터 분석 프로세스 모델&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;분석 단계 &lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;비즈니스 이해 &amp;rarr; 데이터 이해 &amp;rarr; 데이터 준비 &amp;rarr; 모델링 &amp;rarr; 평가 &amp;rarr; 전개&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 수집 방법&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;실시간 데이터 : 오픈 API&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;웹 로그 데이터 : Apache Flume, Scribe, Chukwa 등의 Log Collector 이용&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;웹 메타 데이터 : 스크래핑&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;웹 문서 데이터 : 크롤링&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;병렬 DBMS&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;다양한 동작의 병렬 컴퓨팅을 통해 성능을 개선하고 데이터의 중복의 가능성을 낮게 함&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;다중 중앙처리장치와 디스크를 병렬로 사용함으로써 데이터 처리 및 밉출력 속도를 개선&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 적재, 색인 빌드, 쿼리 평가 등의 다양한 동작의 병렬 컴퓨팅을 통해 성능 개선&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;일반적으로 Massive Parallel Processing 구조이며, 대량의 데이터를 빠르게 적재하고 저장&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;서비스형 인프라스트럭쳐 플랫폼
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;서버, 스토리지, 네트워크를 필요에 따라 인프라 자원을 사용할 수 있도록 클라우드 서비스 제공&lt;/li&gt;
&lt;li&gt;EX)서버 가상화, 데스크톱 가상화 등&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;2과목&amp;nbsp;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;박스 플롯(Box-Plot)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;데이터를 탐색하고 시각화하여 패턴을 식별하기 위하여 박스플롯 이용&lt;/li&gt;
&lt;li&gt;제 1 사분위수는 전체 데이터 중 하위 25%에 해당하는 값&lt;/li&gt;
&lt;li&gt;제 2 사분위수는 중앙값(Median)과 동일&lt;/li&gt;
&lt;li&gt;제 3 사분위수는 전체 데이터 중 상위 25%에 해당하는 값&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;클래스 불균형 문제 처리 방법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;반복 샘플링(Resampling)&lt;/li&gt;
&lt;li&gt;언더 샘플링(Undersampling)&lt;/li&gt;
&lt;li&gt;오버 샘플링(Oversampling)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 정규화&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;분석 모형 구축 시 학습 값들이 적당한 범위를 유지하도록 모형에 입력할 데이터를 반환하는 작업&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 분석 모형 구축 시 고려 사항&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;비용 민감학습 : 소수 클래스 데이터에 더 민감하게 학습하도록 더 큰 클래스 가중치 (비용함수) 지정&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;포아송 분포 (Poisson Distribution)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;확률론에서 단위 시간당 또는 단위 면적(영역) 당 특정 사건의 발생 횟수를 표현하는 이산확률 분포&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;정규성 검정
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;데이터셋의 분포가 정규분포를 따르는 지 검정
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;검정 방법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;샤피로 윌크 테스트 (Shapiro-wilk Test)&lt;/li&gt;
&lt;li&gt;콜모고로프-스미르노프 검정(Kolmogorov_smirnov Test) : K-S 검정&lt;/li&gt;
&lt;li&gt;Q-Q 플롯 (Quantile-quantile Plot)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;카이스퀘어 검정 (Chi-square Test)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;카이제곱 분포에 기초한 통계적 검정 방법&lt;/li&gt;
&lt;li&gt;관찰된 빈도가 기대 빈도와 의미 있게 다른 지의 여부를 검정(동질성, 독립성 검정)하기 위해 사용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;3과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;심슨의 역설 (Simpson Paradox)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각각의 변수에 신경 쓰지 않고 전체 통계 결과를 유추할 때 일어나는 오류로서 사람들의 직관과 반대되는 역설적인 상황이 발생되는 현상&lt;/li&gt;
&lt;li&gt;여러 그룹의 자료를 합했을 때의 결과와 각 그룹을 구분했을 때의 결과가 다를 때
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;부분을 단순히 합친 것 뿐인데 그 결과가 각 부분을 비교했을 때의 결과와 달라지는 것&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;과적합(Overfitting) 감소 방안
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;인공 신경망에서
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;드롭 아웃 (Dropout)&lt;/li&gt;
&lt;li&gt;데이터 학습률 조정&lt;/li&gt;
&lt;li&gt;은닉층 노드 삭제&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;의사결정나무 분석에서&amp;nbsp;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;가지치기 (Tree Pruning)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;의사결정나무에서 과적합을 줄이고 일반화 가능성을 증대시키는 Sub-Tree를 찾는 과정&lt;/li&gt;
&lt;li&gt;의사결정나무에서 과적합을 방지하기 위해 적절한 수준에서 Terminal Node를 결합해 줌&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;인자 분석 (Factor Analysis)
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;분석 대상의 변수들이 상호 연관성을 가지고 소수의 요인으로 분석되는 경우에 사용되고 해당 요인들을 찾아서 변수를 줄이는 차원 축소 방법&lt;/li&gt;
&lt;li&gt;상호 연관된 여러개의 변수들 간의 내부적 상호관계를 변수들 간의 내재하는 소수의 잠재적인 관측 불가능한 인자를 추출해내는 다변량 분석 방법&amp;nbsp;&lt;/li&gt;
&lt;li&gt;인자 분석을 위해 사용되는 공분산 행렬에서의 행, 열의 수는 분석 대상의 변수의 수에 따라 결정됨&lt;/li&gt;
&lt;li&gt;회귀 분석, 상관분석, 판별 분석에 사용될 적은 수의 변수를 새롭게 만들기 위해서 사용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;앙상블 분석
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;여러가지 분석 모형을 조합해 정확도가 높은 최종 모형을 만듦&lt;/li&gt;
&lt;li&gt;단일 분류기보다 신뢰성이 높은 예측값을 도출한다.&lt;/li&gt;
&lt;li&gt;대표적으로&amp;nbsp; Voting, Bagging, Boosting 방법 이용&lt;/li&gt;
&lt;li&gt;최적화 방법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;여러 개의 데이터 분석 모형을 조화롭게 학습시키기&lt;/li&gt;
&lt;li&gt;훈련 데이터셋을 무작으로 다른 데이터셋으로 만들어서 결정트리 분류기를 만들고, 많은 모형들 중에서 가장 많은 선택을 받은 클래스를 예측&lt;/li&gt;
&lt;li&gt;훈련 데이터셋의 중복을 허용하여 샘플링하거나 약한 학습기&amp;nbsp; 여러 개를 서로 연결하고 보완해 가면서 더욱 강한 학습기를 만듦&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;4과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;ROC(Receiver Operating Curve) 그래프
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;성능 평가 지표들 중 거짓긍정률(1-특이도)과 참긍정률(민감도)을 이용하여 표현한 곡선
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;거짓긍정률과 참긍정률은 혼동행렬로부터 구할 수 있음&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;긍정 범주와 부정 범주를 판단하는 기준치의 변화에 따라 참긍정과 거직긍저으이 비율이 어떻게 변화하고 있는지 파악하기 위해 사용됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;과대적합
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;머신러닝에서 자주 발생하며, 데이터 분석모형이 과대적합일 때 일반적으로 분산이 큼&lt;/li&gt;
&lt;li&gt;차수가 높은 비선형 모형의 경우 학습 데이터에만 너무 맞춘 학습이 이뤄져서 정작 테스트 환경에서 는 오히려 예측 정확도가 떨어짐&lt;br /&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;&amp;rArr; 차수가 높을 수록(비선형 모형일수록) 과대적합의 문제가 크게 발생함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;스토리텔링(Storytelling) 수행 절차
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;사용자별 데이터 세트 및 정의&amp;nbsp;&amp;rarr; 사용자 시나리오 작성&amp;nbsp;&amp;rarr; 스토리보드 기획&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;시각화 방법
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;관계 시각화
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;버블 차트 (Bubble Chart)&lt;/li&gt;
&lt;li&gt;산점도 (Scatter Plot)&lt;/li&gt;
&lt;li&gt;히스토그램 (Histogram)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;비교 시각화
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;체르노프 페이스 (Chernoff Face)&lt;/li&gt;
&lt;li&gt;히트맵 (Heat Map)&lt;/li&gt;
&lt;li&gt;스타 차트 (Star Chart)&lt;/li&gt;
&lt;li&gt;평행 좌표 그래프 (Parallel Coordinate Plot)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;데이터 분석 결과에 대한 산출물
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;데이터 분석 계획서&lt;/li&gt;
&lt;li&gt;분석 모형별 예측 결과 보고서&lt;/li&gt;
&lt;li&gt;효과 검증 프로젝트 결과 보고서 ( or 비즈니스 성과 보고서)&lt;/li&gt;
&lt;li&gt;분석 모형 유지 보수 가이드&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>빅분기 공부</category>
      <category>데이터 분석가 부트캠프</category>
      <category>멀티캠퍼스 부트캠프</category>
      <category>부트캠프</category>
      <category>빅데이터 분석기사</category>
      <category>자격증</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/32</guid>
      <comments>https://co-code.tistory.com/32#entry32comment</comments>
      <pubDate>Tue, 4 Aug 2026 23:54:39 +0900</pubDate>
    </item>
    <item>
      <title>제 4회 기출 복원 문제 오답 정리</title>
      <link>https://co-code.tistory.com/31</link>
      <description>&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1과목
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;빅데이터 분석을 위한 로드맵
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;소요 비용 배분, 프로젝트 WBS 수립, 업무 분장 계획 수립&lt;/li&gt;
&lt;li&gt;로드맵 작성 위해 우선 고려할 사항
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;비즈니스 성과 및 ROI 평가, 데이터 분석의 시급성, 데이터 탐색 등&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;고품질 데이터의 특성
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;정확성 (분석 대상에 대한 올바른 값 사용)&lt;/li&gt;
&lt;li&gt;완전성 (결측치 등의 오류가 없음)&lt;/li&gt;
&lt;li&gt;적시성 (유효한 시간 정보 포함)&lt;/li&gt;
&lt;li&gt;일관성 (일관된 속성, 규정, 포맷 및 형식 유지)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;데이터 비식별화 방법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;L-다양성 : 주어진 데이터셋에서 함께 비식별되는 레코드들은 동질 집합에서도 적어도 L개의 서로 다른 민감한 정보를 가져야하는 성질&lt;/li&gt;
&lt;li&gt;개인정보 차등 보호 : 데이터에 수학적 노이즈를 추가(속성의 값을 원래의 값과 다르게 변경)하는 기술&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;분산 파일 시스템 (Distributed File System)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다수의 사용자가 원격으로 데이터를 쉽게 공유할 수 있도록 함&lt;/li&gt;
&lt;li&gt;데이터의 가용성(Availability)을 향상시킴&lt;/li&gt;
&lt;li&gt;데이터를 물리적으로 다른 위치에 중복하여 저장함으로써 디스크에 장애가 발생하더라도 단일 서버 환경에서보다 상대적으로 쉽게 복구될 수 있도록 설계됨&lt;/li&gt;
&lt;li&gt;EX) GFS, HDFS
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;HDFS (Hadoop File System)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;GFS(Google File System)를 모델로 하여 만들어진 오픈소스 (GFS와 동일한 특징 O)&lt;/li&gt;
&lt;li&gt;대용량의 파일을 Chunk라는 단위로 분할해 Data Node에 분산 저장
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Data Node : 블록 복제의 횟수 관리&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Chunk가 어느 데이터 노드에 저장되었는지에 대한 메타 데이터는 Name Node에 저장
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Name Node : 클라이언트가 하둡 처리에 대한 요청을 직접 접수&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;MapReduce 프레임워크를 이용해 분산저장된 파일을 읽어 연산 기능 수행&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;2과목&amp;nbsp;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;인 메모리(In-Memory) 기반 데이터 처리 방식
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;디스크 기반 컴퓨팅과 달리 데이터를 하드 디스크에 저장하고 관리하는 것이 아니라, 전체 데이터를 메모리에 적재하여 사용&lt;/li&gt;
&lt;li&gt;아파치 스파크(Apache Spark)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;대용량의 데이터를 효율적으로 처리하기 위한 오픈 소스 클라우드 플랫폼으로 RDD(Resilient Distributed Dataset)라고 부르는 인-메모리 처리 방식&lt;/li&gt;
&lt;li&gt;머신러닝과 그래프 알고리즘과 같은 반복적인 어플리케이션에 적합&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Ridge Regression (릿지 회귀)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;추정 계수의 제곱합을 최소로 하는 회귀 분석 모형을 찾음&lt;/li&gt;
&lt;li&gt;제곱합을 최소화하기 때문에 계수의 크기가 줄어들어 과적합이 방지되고, 다중 공선성이 분산되어 효과적&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;주성분 분석 (PCA, Principal Component Analysis)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;변수들의 상관관계를 이용하여 기존 변수들을 분산이 큰 변수들로 변환시켜서 유의성이 높은 변수들로 데이터를 표현함으로써 저차원의 데이터로 나타낸다 (차원축소 기법)&lt;/li&gt;
&lt;li&gt;새로 생긴 변수들은 서로 상관관계가 없도록 설계됨&lt;/li&gt;
&lt;li&gt;새로운 변수를 정의하기 때문에 문제의 원인을 추론하기 어려워 직관적 이해가 다른 기법에 비해 다소 어려움&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;시공간 데이터
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;지리 통계 데이터&lt;/li&gt;
&lt;li&gt;그리드 (래스터) 데이터&lt;/li&gt;
&lt;li&gt;격자 데이터&lt;/li&gt;
&lt;li&gt;포인트 패턴&lt;/li&gt;
&lt;li&gt;궤도 데이터&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;초기하분포 (Hypergeometric Distribution)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;유한 모집단에서 비복원 추출의 경우 성공의 수를 확률변수 X로 정의한다면, 확률변수 X의 분포가 초기하분포&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;3과목
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;분류를 위한 종속 변수가 범주형인 경우 사용되는 데이터 분석모형
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;인공 신경망&lt;/li&gt;
&lt;li&gt;서포트 벡터 머신&lt;/li&gt;
&lt;li&gt;의사결정나무&lt;/li&gt;
&lt;li&gt;(선형회귀분석 : 독립변수가 연속형/범주형이고 종속변수가 연속형인 경우 독립변수 이용해 종속 변수 예측)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;의사결정나무
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이산형(범주형) 목표 변수의 경우 목표변수의 각 범주에 속하는 빈도, 연속형(구간형) 목표변수의 경우 목표 변수의 (평균, 표준편차)에 기초하여 분리가 일어남&lt;/li&gt;
&lt;li&gt;분리 기준으로 사용되는 C4.5(혹은 C5.0)알고리즘에서는 엔트로피 지수 사용&lt;/li&gt;
&lt;li&gt;분리 기준으로 사용되는 CHAID, QUEST 알고리즘에서는 카이제곱 통계량을 이용한 F-검정 방법 이용&lt;/li&gt;
&lt;li&gt;목적과 자료구조에 따라 적절한 분리기준과 전지 규칙을 지정하여 의사결정나무 모형 구축&lt;/li&gt;
&lt;li&gt;분류 오류를 크게할 위험이 높거나 부적절한 가지를 제공함으로써 한 범주에 한 종류의 데이터가 남을 때까지 가지치기 수행&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;시계열 자료의 특성
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;계절(Seasonality)&lt;/li&gt;
&lt;li&gt;불규칙(Irregular)&lt;/li&gt;
&lt;li&gt;추세(Trend)&lt;/li&gt;
&lt;li&gt;주기(Cycle)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;시계열 자료에서 고정되지 못하고 증가하거나 감소하는 형태로 나타날 때 주기가 있다고 함&lt;/li&gt;
&lt;li&gt;주로 경제 상황에서 이런 형태가 나타남&lt;/li&gt;
&lt;li&gt;변화가 계절에 의한 것이 아니고, 주기가 긴 경우의 변동 자료에서의 패턴을 나타낼 때 사용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;윌콕슨 부호순위 &amp;amp; 부호순위합 검정
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모집단이 정규성을 만족하지 못할 때 사용&lt;/li&gt;
&lt;li&gt;정규성 검정에서 정규분포를 따르지 않거나 표본의 수가 10개 미만의 소규모로 정규분포를 가정할 수 없을 경우에 순위 데이터를 이용한 비모수적 검정 방법 이용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;4과목
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;ROC (Receiver Operating Charactristic)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;X축 : 1-특이도 (FPRate)&lt;/li&gt;
&lt;li&gt;Y축 : 민감도 (TPRate)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;민감도가 동일할 때 특이도가 클수록(FPRate 값이 작을수록) 분석 모형의 성능이 우수함&lt;/li&gt;
&lt;li&gt;(민감도, 특이도)=(1,0)인 점과 (민감도, 특이도)=(0,1)인 점을 지남&lt;/li&gt;
&lt;li&gt;가장 이상적인 ROC 그래프는 (민감도, 특이도)=(1,1)인 점을 지남&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;과대적합 (Overfitting) 방지 기법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;정보의 양과 종류에 규제(Regulation) 부과&lt;/li&gt;
&lt;li&gt;학습 과정에서 일부를 사용하지 않는 Dropout 적용&lt;/li&gt;
&lt;li&gt;정해진 크기 안에서 가장 큰 값만 추출하는 Max Pooling 기법&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;히스토그램(Histogram)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;양적 자료 표현에 사용됨 (w. 꺾은선 그래프, 누적 백분율 곡선)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&amp;harr; 질적 자료 표현에 사용됨 : 막대 그래프(Bar Chart), 파이 차트(Pie Chart)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;종속 변수를 확률 단위로 표현 가능&lt;/li&gt;
&lt;li&gt;데이터를 잘 표현하려면 구간을 잘 정해야 함&lt;/li&gt;
&lt;li&gt;상대도수 히스토그램에서 구간의 간격으로 상대도수를 나누면, 상대도수 히스토그램은 확률밀도함수를 나타냄&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>빅분기 공부</category>
      <category>데이터 분석가 부트캠프</category>
      <category>멀티캠퍼스 부트캠프</category>
      <category>부트캠프</category>
      <category>빅데이터 분석기사</category>
      <category>자격증</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/31</guid>
      <comments>https://co-code.tistory.com/31#entry31comment</comments>
      <pubDate>Sat, 1 Aug 2026 20:30:47 +0900</pubDate>
    </item>
    <item>
      <title>제 3회 기출 복원 문제 오답 정리</title>
      <link>https://co-code.tistory.com/30</link>
      <description>&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1과목
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;GDPR(General Data Protection Regulation)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;유럽 연합의 법으로서 개인정보 활용 범위와 데이터 비식별화를 통한 개인정보 방안 제시&lt;/li&gt;
&lt;li&gt;유럽 연합에 속해 있거나 유럽 경재 지역에 속해 있는 모든 사람들의 사생활 보호와 개인정보들을 보호해줌&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;데이터 품질 관리 특성
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;정확성
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;분석 객체에 대한 올바른 값을 오류 없이 저장하는 특성&lt;/li&gt;
&lt;li&gt;내재적(고유) 데이터 품질 특성 (Intrinsic Data Quality)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;완전성 : 데이터 식별 수준 만족 (대상, 속성 포함)&lt;/li&gt;
&lt;li&gt;일관성 : 규정, 포맷, 형식 유지&lt;/li&gt;
&lt;li&gt;적시성 : 유효한 시간 정보 확인 (소멸성이 높은 데이터에 대한 품질 기준)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;데이터 웨어하우스 (Data Warehouse)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&amp;nbsp;주제 중심적&lt;/li&gt;
&lt;li&gt;통합적 내용 저장&lt;/li&gt;
&lt;li&gt;시간성을 가지는 비휘발성(비소멸성) 자료의 집합 저장&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;아파치 우지 (Apache Oozie)&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;아파치 하둡(Apache Hadoop)의 Job을 관리하기 위한 위크플로우 스케쥴링 시스탬
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;워크플로우 : 방향성 비사이클 그래프애서 제어 흐름과 액션 노드의 모임
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;제어 흐름 : 워크플로우 시작과 끝(시작, 끝, 실패 노드) 그리고 워크플로우 실행 경로를 제어하기 위한 구조(결정, 포크, 조인 노드) 정의&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;2과목&amp;nbsp;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;주성분 분석 (PCA, Principal Component Analysis)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;서로 연관가능성이 있는 고차원 공간의 표본들을 선형 연관성이 없는 저차원 공간(주성분)의 표본으로 변환하기 위하여 직교 변환을 사용한다.&lt;/li&gt;
&lt;li&gt;공분산 행렬을 이용하여 고유 벡터를 구하며, 공분산 행렬의 고유 벡터가 해당 데이터를 대표하는 주축(주성분)이 된다.&lt;/li&gt;
&lt;li&gt;주성분이 가장 큰 분산을 가지도록 하고, 이후의 주성분들은 이전의 주성분들과 직교하나는 제약 아래에 가장 큰 분산ㅇ르 갖고 있다는 식의 개념을 이용한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;박스칵스 변환 (Box-cox Transformation)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;로그 변환과 거듭곱 변환을 둘다 포함&lt;/li&gt;
&lt;li&gt;데이터를 정규 분포에 가깝게 만들거나 데이터의 분산을 안정화하는 용도로 사용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;군집 추출 (Clustering Random Sampling)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이질적인 군집(집락)으로 구분하고 난 뒤 무작위로 몇 개의 군집을 표본으로 추출하고 군집에 대해서 그 구성요소를 전수조사하거나 표본조사하는 방법으로 표집된다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;중심극한정리(Central Limit Theorm)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;왜도 값과 무관하게 하느이 모집단에서 임의로&amp;nbsp; 추출된 표본의 크기가 큰 경우 표본 평균은 정규분포를 따른다&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;가설 검정 관련 개념
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;검정통계량 : 모집단의 부분집합인 표본으로부터 검정에 대한 결론을 내리고 귀무가설을 기각하거나 채택하는 결정을 내리는데 활용되는 표본의 함수&lt;/li&gt;
&lt;li&gt;기각역 : 가설 검정에서 가설을 통해 얻어진 검정 통계량을 어떤 범위 내에 들어오면 이 가정을 옳지 않다고 판단하며, 이때의 범위 값&lt;/li&gt;
&lt;li&gt;제 2종 오류 (&amp;beta;) : 대립가설이 맞다고 가정할 때, 주어진 검정통계량을 이용하여 대립가설을 기각하면서 생기는 오류값&lt;/li&gt;
&lt;li&gt;유의확률 : 귀무가설이 맞다고 가정할 때, 주어진 검정 통계량을 이용하여 구한 최소의 유의수준 값&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;3과목
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다중 공선성 문제 해결 방안
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다중 공선성 문제를 일으키는 독립(설명)변수들 중 하나 혹은 일부 제거&lt;/li&gt;
&lt;li&gt;릿지(Ridge) 함수를 이용하여 모형의 가중치를 제한하고 다항식 차수 감소시킴&lt;/li&gt;
&lt;li&gt;변수를 변형시키거나 새로운 관측치 이용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;박스칵스(Box-cox) 변환
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;로그변환과 거듭곱 변환을 모두 포함&lt;/li&gt;
&lt;li&gt;데이터를 정규분포에 가깝게 만드거나 데이터의 분산을 안정화하는 용도로 사용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;분산분석(ANOVA : Analysis of Variance)표
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;유의확률(p-value) &amp;lt; 유의수준(&amp;alpha;)이면 회귀식이 유의하다고 판정&lt;/li&gt;
&lt;li&gt;종속변수의 표본분산 : SST/(n-1)&lt;/li&gt;
&lt;li&gt;기본적인 가정을 토대로 이루어짐
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;독립/종속변수의 선형성&lt;/li&gt;
&lt;li&gt;오차의 정규성, 등분산성, 독립성&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;결정계수(종속변수의 전체 분산이 회귀식에 의해 설명되는 비율)이 클수록 좋은 회귀 모형&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;table style=&quot;border-collapse: collapse; width: 49.3023%; height: 134px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 13.1604%; text-align: center;&quot;&gt;요인&lt;/td&gt;
&lt;td style=&quot;width: 14.8113%; text-align: center;&quot;&gt;제곱합&lt;/td&gt;
&lt;td style=&quot;width: 15.0472%; text-align: center;&quot;&gt;자유도&lt;/td&gt;
&lt;td style=&quot;width: 31.0849%; text-align: center;&quot;&gt;제곱평균&lt;/td&gt;
&lt;td style=&quot;width: 25.8962%; text-align: center;&quot;&gt;F&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 13.1604%; text-align: center;&quot;&gt;회귀&lt;/td&gt;
&lt;td style=&quot;width: 14.8113%; text-align: center;&quot;&gt;SSR&lt;/td&gt;
&lt;td style=&quot;width: 15.0472%; text-align: center;&quot;&gt;1&lt;/td&gt;
&lt;td style=&quot;width: 31.0849%; text-align: center;&quot;&gt;MSR=SSR/1&lt;/td&gt;
&lt;td style=&quot;width: 25.8962%; text-align: center;&quot; rowspan=&quot;3&quot;&gt;F=MSR/MSE&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 13.1604%; text-align: center;&quot;&gt;잔차&lt;/td&gt;
&lt;td style=&quot;width: 14.8113%; text-align: center;&quot;&gt;SSE&lt;/td&gt;
&lt;td style=&quot;width: 15.0472%; text-align: center;&quot;&gt;n-2&lt;/td&gt;
&lt;td style=&quot;width: 31.0849%; text-align: center;&quot;&gt;MSE=SSE/(n-2)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 13.1604%; text-align: center;&quot;&gt;전체&lt;/td&gt;
&lt;td style=&quot;width: 14.8113%; text-align: center;&quot;&gt;SST&lt;/td&gt;
&lt;td style=&quot;width: 15.0472%; text-align: center;&quot;&gt;n-1&lt;/td&gt;
&lt;td style=&quot;width: 31.0849%; text-align: center;&quot;&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;인공신경망의 하이퍼파라미터
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;하이퍼파라미터 : 학습률, 은닉층의 개수, 배치 크기, 훈련 반복횟수, 손실 함수, 가중치 초기화&lt;/li&gt;
&lt;li&gt;파라미터 : 가중치, 편향(Bias), 결과값&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;자기 상관 (Auto Correlation)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;시간 또는 공간적으로 연속된 일련의 시계열 관측값들 사이에 존재하는 상관관계&lt;/li&gt;
&lt;li&gt;시계열 데이터에서 시차 값 사이의 선형관계 측정 위해 사용됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;CNN(합성곱 신경망)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;합성곱 연산&lt;/li&gt;
&lt;li&gt;Feature Map을 이용한 학습&lt;/li&gt;
&lt;li&gt;로봇 이미지 인식, 컴퓨터 비전, 영상분석 및 인식&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;RNN(순환 신경망)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;노드 간 연결이 순환 구조를 가짐&lt;/li&gt;
&lt;li&gt;주기 예측 등 순차적 데이터 처리 분야를 활용&lt;/li&gt;
&lt;li&gt;필기체 텍스트, 음성, 언어 번역&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;GAN(생성적 적대 신경망)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;제로섬(Zero-Sum) 게임 틀 내에서 서로 경쟁하는 신경망 활용&lt;/li&gt;
&lt;li&gt;가짜 생성 모델에 대한 진위 여부 판별 모델의 경쟁&lt;/li&gt;
&lt;li&gt;컴퓨터 게임, 패션, 광고&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;강화학습
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;행동심리학에서 영감을 받음&lt;/li&gt;
&lt;li&gt;마코프 프로세스 결정모델 활용&lt;/li&gt;
&lt;li&gt;게임, 제어, 정보이론, 다중 에이전트 시스템&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;심층 신뢰 신경망(DBN : Deep Belief Network)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다층의 잠재변수로 표현되는 은닉층으로 구성&lt;/li&gt;
&lt;li&gt;레이블이 없는 데이터에 대한 비지도 학습 방법 이용&lt;/li&gt;
&lt;li&gt;학습 데이터가 충분하지 않을 때 유용&lt;/li&gt;
&lt;li&gt;RBM(Restricted Boltzman Machine)을 층층이 쌓아 구성&lt;/li&gt;
&lt;li&gt;부분 이미지에서 전체를 연상시키는 일반화과정 구현&lt;/li&gt;
&lt;li&gt;글씨 인식, 음성 데이터를 이용한 감성 분석에 활용됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;인공신경망에서 사용되는 활성화함수(Activation Function)&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;활성화 함수 : 입력된 가중합을 출력신호로 변환하는 함수
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;은닉층의 수가 많아지면 매개변수의 수를 줄여 필요한 연산의 수 감소&lt;/li&gt;
&lt;li&gt;시그모이드
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;정의역 : 실수 전체&lt;/li&gt;
&lt;li&gt;유한한 구간 사이의 한정된 값 변환&lt;/li&gt;
&lt;li&gt;정의역의 절댓값이 클수록 미분값이 0으로 수렴 &amp;rArr; 가중치 업데이트 X, 기울기 손실 형상 발생&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;딥러닝 심층인공신경망에서 사용되는 경사하강법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Momentum&lt;/li&gt;
&lt;li&gt;NAG(Nesterov Accelerated Gradient)&lt;/li&gt;
&lt;li&gt;AdaGrad(Adaptive Gradient)&lt;/li&gt;
&lt;li&gt;RMSProp&lt;/li&gt;
&lt;li&gt;AdaDelta&lt;/li&gt;
&lt;li&gt;Adam(Adaptive Momentum Estimation)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;앙상블(Ensemble) 기법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;배깅(Bagging) : Bootstrap + Aggregation
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;샘플을 여러번 뽑아 각 모델을 학습시켜 결과물을 집계&lt;/li&gt;
&lt;li&gt;EX) Random Forest&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;부스팅(Boosting)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;가중치를 활용하여 약 분류기를 강 분류기로 만드는 방법&lt;/li&gt;
&lt;li&gt;AdaBoost, XGBoost, Arc-x4&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;윌콕슨 부호순위 검정
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;두 모집단에 대한 분포의 가정이 어렵거나 표본의 가정이 어렵거나 표본이 순위로밖에 표현될 수 없을 때, 두 모집단의 확률분표가 동일한지에 대한 가설 검정&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;프라이드만(Friedman) 검정
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;동일한 케이스에 대해 반복된 측정이 이어졌을 때 세 개 이상의 집단 비교를 위해 사용되는 비모수 검정 방법&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;4과목&amp;nbsp;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;평균 절대 백분 오차 비율 &lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;(MAPE : Mean Absolute Percentage Error)&lt;/span&gt;&amp;nbsp;
&lt;ul style=&quot;list-style-type: disc; color: #333333; text-align: start;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;실제 데이터에서 오차가 어느 정도 비율로 발생했는지 평가하기 위하여 종속변수 값 대비 예측 오차 비율의 절대값을 평균한 값&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;인공 신경망 과적합 방지 방법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모델의 복잡도 줄이기 (은닉층 or 매개변수 수 줄이기)&lt;/li&gt;
&lt;li&gt;가중치 규제&lt;/li&gt;
&lt;li&gt;드롭아웃 (학습과정에서 신경망의 일부를 사용하지 X)&lt;/li&gt;
&lt;li&gt;적절한 학습률 유지&lt;/li&gt;
&lt;li&gt;&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;혼동 행렬
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;민감도(Senstivity, Recall) =TP/(TP+FN)&lt;/li&gt;
&lt;li&gt;정밀도(Precision)=TP/(FP+TP)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;table style=&quot;border-collapse: collapse; width: 61.3956%; height: 61px;&quot; border=&quot;1&quot; data-ke-style=&quot;style12&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 10px;&quot;&gt;
&lt;td style=&quot;width: 35.178%; height: 27px;&quot; colspan=&quot;2&quot; rowspan=&quot;2&quot;&gt;구분&lt;/td&gt;
&lt;td style=&quot;width: 94.1584%; height: 10px;&quot; colspan=&quot;2&quot;&gt;예측 범주값&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 17px;&quot;&gt;
&lt;td style=&quot;width: 33.2126%; height: 17px;&quot;&gt;Yes(참)&lt;/td&gt;
&lt;td style=&quot;width: 60.9458%; height: 17px;&quot;&gt;No(거짓)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 17px;&quot;&gt;
&lt;td style=&quot;width: 20.0218%; height: 34px;&quot; rowspan=&quot;2&quot;&gt;실제 범주값&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;width: 15.1562%; height: 17px;&quot;&gt;Yes(챰)&lt;/td&gt;
&lt;td style=&quot;width: 33.2126%; height: 17px;&quot;&gt;O (TP : True Positive)&lt;/td&gt;
&lt;td style=&quot;width: 60.9458%; height: 17px;&quot;&gt;X (FN : Fale Negative)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 17px;&quot;&gt;
&lt;td style=&quot;width: 15.1562%; height: 17px;&quot;&gt;No(거짓)&lt;/td&gt;
&lt;td style=&quot;width: 33.2126%; height: 17px;&quot;&gt;X (FP : False Positive)&lt;/td&gt;
&lt;td style=&quot;width: 60.9458%; height: 17px;&quot;&gt;O (TN :True Negative)&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>빅분기 공부</category>
      <category>데이터 분석가 부트캠프</category>
      <category>멀티캠퍼스 부트캠프</category>
      <category>부트캠프</category>
      <category>빅데이터 분석기사</category>
      <category>자격증</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/30</guid>
      <comments>https://co-code.tistory.com/30#entry30comment</comments>
      <pubDate>Sat, 1 Aug 2026 19:50:40 +0900</pubDate>
    </item>
    <item>
      <title>멀티캠퍼스 KDT 데이터 분석가 최종 프로젝트 5차 수행일지</title>
      <link>https://co-code.tistory.com/29</link>
      <description>&lt;p&gt;&lt;figure class=&quot;fileblock&quot; data-ke-align=&quot;alignCenter&quot;&gt;&lt;a href=&quot;https://blog.kakaocdn.net/dn/nnSs5/dJMcaazupB6/pqGTK6VDIETIOUj0jlbo8k/%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8_%EC%88%98%ED%96%89%EC%9D%BC%EC%A7%80_%280728%7E0731%29.docx?attach=1&amp;amp;knm=tfile.docx&quot; class=&quot;&quot;&gt;
    &lt;div class=&quot;image&quot;&gt;&lt;/div&gt;
    &lt;div class=&quot;desc&quot;&gt;&lt;div class=&quot;filename&quot;&gt;&lt;span class=&quot;name&quot;&gt;프로젝트_수행일지_(0728~0731).docx&lt;/span&gt;&lt;/div&gt;
&lt;div class=&quot;size&quot;&gt;0.04MB&lt;/div&gt;
&lt;/div&gt;
  &lt;/a&gt;&lt;/figure&gt;
&lt;/p&gt;</description>
      <category>데이터 분석 프로젝트</category>
      <category>데이터분석</category>
      <category>데이터분석가</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/29</guid>
      <comments>https://co-code.tistory.com/29#entry29comment</comments>
      <pubDate>Sat, 1 Aug 2026 16:26:06 +0900</pubDate>
    </item>
    <item>
      <title>제 2회 기출 복원 문제 오답 정리</title>
      <link>https://co-code.tistory.com/28</link>
      <description>&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;개인정보보호법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;개인정보 : 신분관계, 내면의 비밀, 심신의 상태, 사회 경력, 경제 관계, 기타 생체 인식 정보, 위치 정보 등&lt;/li&gt;
&lt;li&gt;개인정보 처리자의 의무사항
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;개인 정보의 수집, 이용 및 재공, 관리(보관), 파기&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;2과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;상관계수 (r)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;두 개의 연속형 변수에 대해 두 변수 간에 관계가 있는지, 어떤 관계가 있는지 알아보기 위해 사용&lt;/li&gt;
&lt;li&gt;[-1,1]의 범위를 가짐
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;r&amp;gt;0 : 양의 상관관계&lt;/li&gt;
&lt;li&gt;r&amp;lt;0 : 음의 상관관계&lt;/li&gt;
&lt;li&gt;r=0 : 두 변수 사이의 선형적 관계가 없다&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;병렬 차트
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;여러 범주의 데이터를 비교하기 위해 사용&lt;/li&gt;
&lt;li&gt;차원을 행, 측정값을 열에 배치하거나 그 반대로 배치하여 차트 제작&lt;/li&gt;
&lt;li&gt;그룹화된 막대 형식(병렬 막대 차트)으로 표현되기도 함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;층화 표본 추출 방법
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모집단을 둘 이상의 층으로 나누고 각 층마다 독립적으로 단순 임의 추출&lt;/li&gt;
&lt;li&gt;집단 내 동질적, 집단 간 이질적 (&amp;harr; 집락 추출법)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;가설 검정의 오류
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;제 1종 오류
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;귀무가설이 참인데 귀무가설 기각&lt;/li&gt;
&lt;li&gt;유의 수준 (&amp;alpha;)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;제 2종 오류
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;대립가설이 참인데 대립가설 기각 (귀무가설이 거짓인데 귀무가설 채택)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;3과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;빅데이터 분석 모델링 절차 : 데이터 분할 &amp;rarr; 데이터 모델링 &amp;rarr; 모델 적용 및 운영 방안 마련 &amp;rarr; 모델 평가 &amp;rarr; 모델 검증&lt;/li&gt;
&lt;li&gt;인공신경망 하이퍼 파라미터
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;가중치의 초기값, 학습률, 손실함수, 훈련 반복 횟수
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;가중치, 편향 : 역전파 알고리즘 등을 통해 개선되는 파라미터&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;다차원 척도법(MDS)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;유사성(or 비유사성)을 저차원의 공간에 기하학적으로 나타내어 글들의 관계를 탐색적으로 분석하고 이를 저차원의 현상 공간(Configuration Space)에 표현하는 다변량 분석 기법&lt;/li&gt;
&lt;li&gt;계량형 척도(양적 자료)의 경우 스펙트럼 분해(Spectral Decomposition)방법으로 차원 축소&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;베이지안 기법을 이용한 P(B|X) = P(B)P(X|B)/{P(A)P(X|A)+P(B)P(X|B)}&lt;/li&gt;
&lt;li&gt;그래프 분석(Graph Analysis) : 기업 내에 축적되는 트랜잭션 데이터를 분석하기 위하여 사용
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;트랜잭션 데이터
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;형식 : 이벤트 ID, 발생 시각, 이벤트 속성 값, 이벤트에 포함된 개체 등&lt;/li&gt;
&lt;li&gt;기업 내 OLTP 시스템으로부터 발생&lt;/li&gt;
&lt;li&gt;그래프 모델링 과정을 거쳐 그래프 데이터로 변환 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;배깅(Bagging) VS 부스팅(Boosting)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;배깅(Bagging : Bootstrap Aggregation)&amp;nbsp;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;샘플을 여러번 뽑아 (Bootstrap) 각 모델을 학습시켜 결과물을 집계(Aggregation)&lt;/li&gt;
&lt;li&gt;EX) 랜덤 포레스트&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;부스팅(Boosting)
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;가중치를 활용하여 약 분류기를 강 분류기로 만드는 방법&lt;/li&gt;
&lt;li&gt;EX) AdaBoost, XGBoost, Arc-x4&lt;/li&gt;
&lt;li&gt;Stacking(or Meta Modeling) : 서로 다른 모델들을 조합해 최고의 성능을 내는 모델 선정 방법&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;랜덤포레스트 (RandomForest)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Decision Tree들을 엮어서 Forest를 만듦으로써 더 좋은 예측을 하는 기법&lt;/li&gt;
&lt;li&gt;Decision Tree 셍성 방법을 이용하여 이들의 결과를 Majority Voting 등의 방법으로 종합&lt;/li&gt;
&lt;li&gt;알고리즘이 비교적 단순하며, 과적합의 가능성이 낮다.&lt;/li&gt;
&lt;li&gt;Decision Tree를 만들기 위한 Memory 사용량이 많고 학습 데이터의 양이 증가한다고 해도 성능이 급격하게 향상되지는 않음&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;4과목
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;선형 회귀
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;회귀식의 유의성 검정을 위하여 단순선형회귀 분석모형의 경우 t 분포, 여러개의 독립변수에 대한 다중선형회귀 분석모형의 경우 F 분포 이용&lt;/li&gt;
&lt;li&gt;독립변수와 종속변수가 각각 1개인 경우 단순선형회귀분석&lt;/li&gt;
&lt;li&gt;회귀분석모형에 대한 가설 검정을 우이한 귀무가설을 일반적으로 '설정된 회귀모형은 타당하지 않다 (유의하지 않다)'로 설정&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;혼동 행렬
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;민감도(Recall, Sensitivity) = TP/(TP + FP) : 긍정인 범주 중 긍정으로 올바르게 예측한 비율&lt;/li&gt;
&lt;li&gt;정밀도(Precision) = TP?(TP+FN)&lt;/li&gt;
&lt;li&gt;특이도
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;부정인 범주 중 부정으로 올바르게 예측한 비율&lt;/li&gt;
&lt;li&gt;1-특이도(거짓 긍정률 : FPR) : 부정인 범주 중 긍정으로 잘못 예측한 비율&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;회귀분석모향 구축시 잔차(Residual)의 가정
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;등분산성, 독립성, 정규성(정상성)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;홀드아웃 vs K-Fold
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;홀드 아웃
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;훈련 집합(Train Set) 이용하여 분석 모형 구축&lt;/li&gt;
&lt;li&gt;시험 집합(Test Set) 이용하여 성능 평가&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;K-Fold
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;&amp;nbsp;데이터 집합을 무작위로 동일한 크기를 갖는 K개의 부분집합으로 나누고, 그 중 1개를 시험집합(Test Set)으로, 나머지 K-1개를 훈련집합(Train Set)으로 설정하여 분석 모형 평가&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;빅데이터 분석 모형의 평가
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;편향과 분산은 한쪽이 증가하면 다른 한쪽이 감소하고, 한쪽이 감소하면 다른 한쪽이 증가하는 경향이 있으므로 훈련이 적절하게 되어있고 편향과 분산이 적정한 값을 유지하는 분석모형을 설계하는 것이 바람직&lt;/li&gt;
&lt;li&gt;데이터 분석 모형의 예측값들의 분산은 예측값들 평균 차이의 제곱의 평균으로 구한다.&lt;/li&gt;
&lt;li&gt;데이터 분석 모형의 예측값들의 평균과 실제 정답값의 차이를 편향(Bias)&lt;/li&gt;
&lt;li&gt;예측값들의 정답이 멀리 떨어져 있으면 결과의 편향이 높다고 하고, 예측값들이 자기들끼리 멀리 흩어져 있으면 분산이 높다고 함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>빅분기 공부</category>
      <category>데이터 분석가 부트캠프</category>
      <category>멀티캠퍼스 부트캠프</category>
      <category>부트캠프</category>
      <category>빅데이터 분석기사</category>
      <category>자격증</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/28</guid>
      <comments>https://co-code.tistory.com/28#entry28comment</comments>
      <pubDate>Thu, 30 Jul 2026 22:16:42 +0900</pubDate>
    </item>
    <item>
      <title>멀티캠퍼스 KDT 데이터 분석가 최종 프로젝트 4차 수행일지</title>
      <link>https://co-code.tistory.com/27</link>
      <description>&lt;p&gt;&lt;figure class=&quot;fileblock&quot; data-ke-align=&quot;alignCenter&quot;&gt;&lt;a href=&quot;https://blog.kakaocdn.net/dn/Ju6mX/dJMb991AgZN/vgov8ekJeCYxRk5c92DO00/%ED%94%84%EB%A1%9C%EC%A0%9D%ED%8A%B8_%EC%88%98%ED%96%89%EC%9D%BC%EC%A7%80_%280720%7E0725%29.docx?attach=1&amp;amp;knm=tfile.docx&quot; class=&quot;&quot;&gt;
    &lt;div class=&quot;image&quot;&gt;&lt;/div&gt;
    &lt;div class=&quot;desc&quot;&gt;&lt;div class=&quot;filename&quot;&gt;&lt;span class=&quot;name&quot;&gt;프로젝트_수행일지_(0720~0725).docx&lt;/span&gt;&lt;/div&gt;
&lt;div class=&quot;size&quot;&gt;0.04MB&lt;/div&gt;
&lt;/div&gt;
  &lt;/a&gt;&lt;/figure&gt;
&lt;/p&gt;</description>
      <category>데이터 분석 프로젝트</category>
      <category>데이터분석</category>
      <category>데이터분석가</category>
      <author>co-code</author>
      <guid isPermaLink="true">https://co-code.tistory.com/27</guid>
      <comments>https://co-code.tistory.com/27#entry27comment</comments>
      <pubDate>Sun, 26 Jul 2026 13:00:02 +0900</pubDate>
    </item>
  </channel>
</rss>