co-code 님의 블로그

제 7회 기출 복원 문제 오답 정리 본문

빅분기 공부

제 7회 기출 복원 문제 오답 정리

co-code 2026. 8. 10. 23:52
  • 1과목
    • 빅데이터 분석 플랫폼
      • 빅데이터를 처리하는 과정에서 발생하는 컴퓨팅, 저장, 네트워크 부하를 기술적인 요소로 해결하기 위해 설계됨
      • 소프트웨어 계층, 플랫폼 계층, 인프라스트럭쳐 계층으로 구성됨
        • 소프트웨어 계층 - 데이터 처리, 분석, 수집, 정제 기능 수행
        • 플랫폼 계층 - 작업 스케쥴링, 자원할당 및 관리, 프로파일링 기능 수행
        • 인프라스트럭쳐 계층 
          • 사용자 요청 파싱, 자원 배치, 노드 관리, 스토리지 관리, 네트워크 관리, 서비스 관리, 모니터링, 보안 모듈이 포함됨
          • 빅데이터 처리 및 분석에 필요한 자원 제공
    • 빅데이터 분석 기획의 주요 업무
      • 빅데이터 분석 결과의 도출 및 관리를 위한 사전 계획 수립
      • 빅데이터 분석 수행 시 필요한 가용 데이터를 확인하고, 발생할 수 있는 장애 요인에 대처하기 위한 사전 계획 수립
      • 빅데이터 분석을 통해 그 가치가 창출될 수 있는 실용적이고 적절한 활용 방안과 Use Case 탐색
      • (상세 알고리즘 설계는 빅데이터 분석 기획 업무 수행 후 데이터 마이닝/데이터 분석 모델 구축 업무에서 수행)
    • 반정형 데이터 (Semi-Structured Data)
      • 데이터의 형식과 구조가 변경될 수 있는 데이터
      • 구조 정보와 함께 제공하는 파일 형식의 데이터
      • HTML, XML, RDF(Resource Description Framework), JSON 등
      • 정형 데이터에 비해 확장이 더 유연하고 간단함
      • 기존 방식으로 캡쳐되거나 형식이 지정되어 있지 않음
      • 원시 또는 비정형 상태가 아니며, 태그 조직 메타 데이터와 같은 일부 구조적 요소가 내제되어 있음
      • 고정된 스키마가 없어 테이블 형식이나 관계형 데이터 베이스의 형식을 따르지 않음
    • 정형 데이터 품질 검증 방법
      • 업무 규칙
        • 업무와 관련된 모든 데이터의 규칙
        • 조직에서 데이터 품질을 지속적으로 관리하기 위해 사용하는 데이터 규칙
        • 데이터 값이 정확하기 위한 조건 표현
        • 데이터 관리 문서에 명시된 데이터 규칙, 업무 담당자가 지식으로 알고 있는 규칙, 응용 프로그램에 코딩된 규칙 등의 산재되어 분산관리되고 있는 규칙을 통합한 것
        • 조직 내부에서 운영하고 있는 정보 시스템의 품질을 지속적으로 관리하기 위해 활용됨
      • Data Profiling 기법
        • 데이터 소스에 대해 일련의 데이터 검사 절차를 수행함으로써, 데이터에 관한 중요한 정보와 통계치를 수집하는 작업
        • 누락 값, 값의 허용범위, 허용 값 목록, 문자열 패턴, 날짜 유형, 유일값, 데이터 구조, 기타 도메인 분석 작업 필요
      • Meta Data 수집
        • 프로파일링을 수행하기 이전 단계에서 수행되며, 데이터의 부정확성을 판단하는데 중요한 기초 자료가 됨
    • HDFS (Hadoop Distributed File System, 하둡 분산 파일 시스템)
      • 하둡이 실행하는 파일 관리 시스템
      • 대용량 데이터 처리, 용량 확장성, 높은 처리량, 슬레이브 노드(데이터 노드)의 데이터 손실 방지 기능 제공
      • 마스터 노드인 네임 노드(2개 이상으로 구성, 메타 데이터)와 슬레이브 노드인 데이터 노드(블록 형태의 파일)로 구성
      • 네임 노드가 정상적으로 작용하지 않으면, 전체 시스템이 중단됨
      • 데이터 블록 단위로 나눠서 저장
        • 블록 단위가 256MB일 때, 1GB 파일은 4개의 블록으로 나누어 저장됨
        • 10MB 파일은 하나의 블록으로 저장됨
  • 2과목
    • 이상치 판단 방법 (독립변수 2개, 종속변수 1개일 경우)
      • 데이터 히스토그램을 그려서 극단적으로 높거나 낮은 값을 이상치로 판단
      • 데이터 값이 평균에서 얼마나 표준편차만큼 떨어져 있는지를 측정(Z-Score)하여 이상값을 판단
      • 박스플롯에서 사분위수 범위를 이용하여 시각적으로 이상치를 판단
    • SVD (특이값 분해)
      • 행렬을 특정한 구조(3개 요소, 2개의 직교행렬과 특이값(0이 아닌 대각 원소값)을 가지는 행렬)로 분해하는 방법
      • 데이터 축소, 최소제곱해 문제, 영상 처리 및 압축, 군집 개수 결정, 이상치 감지, 잡음 제거, 경향 분석 등에 사용됨
    • 원-핫 인코딩 (One-hot Encoding)
      • 표현하고 싶은 범주형 변수의 인덱스에 1, 다른 인덱스에는 0을 부여하는 벡터 표현 방식
    • 명목형(혹은 범주형) 자료 요약시 사용하는 그래프
      • 파레토 차트 (Pareto Chart)
      • 선 그래프 (Line Chart)
      • 점 그래프 (Dot Plot)
    • 히스토그램(Histogram)
      • 연속형 변수의 값 또는 분포 형태를 나타내기 위해 사용
    • 공분산 이용한 상관계수 공식
      • X, Y의 상관계수 = X, Y의 공분산 / (X의 표준편차 × Y의 표준편차)
    • 최빈값
      • 관측값에서 빈도가 가장 많은 값
      • 범주형 자료의 대푯값으로 주로 이용됨
      • 자료에서 도수가 가장 큰 값이 한 개 이상 있으면 그 값이 모두 최빈값임
      • 이상값에 큰 영향 받지 X
    • 데이터의 중심 위치(중심 경향값, Central Tendency)를 나타내는 기술 통계량
      • 평균
      • 중앙값
      • 최빈값
    • 데이터의 흩어짐 정도(분포)를 나타내는 기술 통계량
      • 분산
      • 표준편차
      • 범위
    • 중심극한정리(CLT, Central Limit Theorm)
      • 동일한 확률 분포를 가진 확률 변수 n(보통 30 이상)개의 평균의 분포는 정규분포에 가까워짐
      • 모집단의 분포에 대한 어떤 정보 없이 평균, 표준편차만 알고 있더라도 표본 평균의 분포를 점근적으로 알 수 있음
        • 여기서 모집단은 임의의 모집단
  • 3과목
    • 계층적 군집 분석
      • 사전에 군집의 개수를 지정할 필요 X
      • 주로 자료의 크기가 작은 경우
      • 개별 대상들 사이의 거리에 의해 가장 가까이에 있는 대상들로부터 결합해 군집 형성
    • Transformer
      • (Self) Attention 매커니즘이 적용된 딥러닝 모델
        • 주요 기능
          • Input/Output Emb=edding
          • Positional Encoding
          • Multi-head Attention
          • Feed Forward
    • LSTM(Long Short Term Memory)
      • RNN 개선
      • Forget/Input/Output Gate 이용
    • 비정형 데이터 분석을 위해 사용되는 언어 모델(Language Model)
      • Bidirectional Encoder Representations for Transformers(BERT)
      • Latent Semantic Analysis
      • N-gram
    • YOLO (You Only Look Once)
      • 최점단 실시간 Object Detection 시스템
      • 물체 감지와 객체 인식에 대한 딥러닝 기반 접근 방식을 사용하여 빠르고 정확한 데이터 처리 속도(실시간 의사결정에 우수한 성능 O)를 나타냄
      • 입력된 이미지를 일정 분할로 그리드 작업 후, 신경망을 통과하여 Bounding Box와 Class 예측을 생성하여 최종 감지 출력을 결정함
      • 실제 이미지와 비디오에서 사전에 먼저 데이터셋에 대한 여러 인스턴스들을 학습함
  • 4과목
    • 신뢰구간
      • 모집단의 표준편차를 알고 있는 경우 또는 표본의 크기가 큰 경우 모평균의 신뢰구간의 표준정규분포 이용
      • 표준편차를 모르고 표본의 크기가 작으면, 자유도가 n-1인 t-분포 이용
      • 모분산 및 모표준편차에 대한 신뢰구간은 카이제곱(자유도=n-1) 분포 이용
    • 정준상관분석(CCA, Canonical Correlation Analysis)
      • 두개 이상의 집단의 연관성(상관관계)을 확인하기 위해 사용됨
      • 두 변수 집단의 상관성을 구하기 위해 상관계수 이용
      • 상관분석과 회귀 분석이 결합 확장된 분석방법
      • 두 변수 집단 (X₁, X₂)와 (Y₁, Y₂, Y₃)사이의 선형 결합 변수를 각각 W, V라고 할 때, 정준상관계수는 변수 W와 V의 상관계수를 구하여 분석함
    • 머신러닝 기반 데이터 분석 모형의 성능 평가
      • 학습 데이터가 적고 분석 모형이 복잡한 경우 과대 적합(Overfitting)의 위험이 높아짐
      • 데이터 분석 모형의 성능을 높이기 위해 일반적으로 학습, 검증 데이터를 이용하여 하이퍼 파라미터를 최적화함
      • 데이터 분석 모형의 복잡한 경우 학습 데이터의 수준을 높여 과적합 방지, 모형 성능 향상, 일반화 능력 향상, 신뢰성 있는 평가를 받도록 해야 함
      • 어떤 시점에서는 추가 데이터의 수가 모형의 성능에 큰 영향을 미치지 않아 데이터의 수가 많아질수록 항상 모형의 성능이 향상되는 것은 아님