co-code 님의 블로그

제 6회 기출 복원 문제 오답 정리 본문

빅분기 공부

제 6회 기출 복원 문제 오답 정리

co-code 2026. 8. 8. 16:40
  • 1과목
    • 빅데이터 분석 조직 구조
      • 집중 구조
        • 전담 조직에서 분석 업무를 담당하여 우선 순위의 업무를 수행할 수 있으나 타 부서와의 업무 중복 및 이원화 가능성이 높음
      • 기능 구조
        • 각 해당 부서에서 업무를 수행하며, 과거에 국한된 분석 수행 가능성이 높고 전사적인 핵심 분석이 어렵음
      • 분석 구조
        • 분석 인력을 현업 부서에 배치하여 전사적 차원의 우선순위 업무를 수행함으로써 빠른 피드백 및 모범 사례의 공유가 가능하나 부서별 역할분담을 사전에 명확하게 설정하여야 함
    • NCS에서 정의한 빅데이터 분석 업무 기획 단계
      1. 도메인 이슈 도출 : 대상 과제의 현황을 파악하고 개선과제를 정의하는 빅데이터 요건 정의서 수립
      2. 분석 목표 수립 : 빅데이터 분석을 통해 얻고자 하는 목표를 정의한 분석 목표 정의서 수립
      3. 프로젝트 계획 : 빅데이터 분석을 위한 예산, 소요기간, 현재의 IT 환경 등을 고려하여 WBS 설계
      4. 보유 데이터 자산 확인 : 분석 목표와 프로젝트 계획에 따른 사전 데이터 점검 (데이터 품질, 분량, 수집 경로)
    • 분석 준비도(Readiness) 진단 위한 평가 영역
      • 분석 업무 파악 : 예측 분석, 시뮬레이션 분석, 최적화 분석 업무 등
      • 분석 인력·조직 : 전문가 직무, 교육 훈련 프로그램, 관리자 능력, 전사 총괄 조직, 경영진 이해 등
      • 분석 기법 : 분석 기법 라이브러리, 효과성 평가, 정기적 개선 등
      • 분석 데이터 : 데이터 확보, 비구조적 데이터 관리, 외부 데이터 활용 체계, 기준 데이터 관리
      • 분석 문화 : 의사결정 구조, 관리자 데이터 중시, 데이터 활용, 데이터 공유 및 협업 문화 등
      • IT 인프라 : 데이터 통합, 데이터 유통 체계, 전용 서버 및 스토리지 확보, 분석 환경 등
    • 데이터 전처리 작업
      • 데이터 정제 (Data Cleansing)
        • 수집 데이터의 불일치성을 교정하기 위한 과정으로 결측값 처리, 이상치 및 잡음(3×표준편차보다 큰 값) 제거 업무
      • 데이터 유형 변환 (Data Type Transformation)
        • 데이터를 분석 목적에 맞게 하고 분석이 용이한 형태로 변하는 작업
      • 데이터 저장 시스템
        • 데이터 웨어하우스
          • 사용자의 의사결정에 도움을 주기 위하여 기간 시스템의 데이터 베이스에 축적된 데이터를 공통의 형식으로 변환해서 관리하는 데이터베이스
        • 데이터 마트
          • 데이터 웨어하우스의 좀 더 경량화된 형태
          • 전사적으로 운영되는 데이터 웨어하우스와 다르게 본부별, 부서별, 또는 업무 영역별로 구성이 되는 소규모 데이터 웨어하우스 
          • 데이터 소매점(데이터 마트)에는 데이터를 공급하는 데이터 도매점(데이터 웨어하우스)이 있음
        • 데이터 레이크
          • 데이터 마트와 달리 데이터를 더 많이 모으기 위해 등장한 개념
          • 다양한 종류의 데이터를 모으는 관점에서 고안된 개념
        • 데이터 댐
          • 여러 곳에서 생산되는 데이터를 수집, 분류, 가공해 누구나 쉽게 인공지능과 네트워크를 결합해 쓸 수 있도록 공급하는 시스템 개념
  • 2과목
    • 데이터 전/후 처리
      • 데이터 전처리 : 필터링, 유형변환, 정제 등
      • 데이터 후처리 : 변환, 통합, 축소 등
      • 절차 : 분석 대상의 데이터 수집 → 데이터 전/후처리 → 데이터베이스에 적재
    • Map Reduce의 디자인 패턴(Design Pattern)
      • 요약 패턴 : 데이터 요약, 그룹핑, 최상위 수준의 요약 결과 확인
      • 필터링 패턴 : 데이터 Subset 및 특정 사용자 생성 Record 확인
      • 데이터 조직화 패턴 : 타 시스템 작업, 맵리듀스 분석, 데이터 조직화 처리
      • 조인 패턴 : 데이터들 사이의 특별한 관계를 발견하기 위해 데이터세트를 함께 분석할 수 있는 해법 제공 
      • 메타 패턴 : 여러 문제 동시 해결 동일 Job으로 여러 분석 수행을 위한 패턴 조합
      • 입출력 패턴 : 데이터 적재, 저장을 위한 하둡 시스템 Customizing
    • 이상값(Outlier) 처리
      • 이상값
        • 관측된 데이터의 범위에서 많이 벗어난 아주 작은 값이나 아주 큰 값
        • 의사 결정에 큰 영향을 미칠 수 있어 데이터 전처리 과정에서 적절한 처리가 필수적
      • 이상값 처리 위해 박스플롯을 사용하는 경우 사분위수 범위 값을 이용하여 탐지할 수 있음
      • 분석의 목적이나 종류에 따라 이상값을 제거하거나 대체
      • 이상값 대체 위해 평균, 최빈값, 중앙값, 예측값 등 이용
        • 이상값을 이 값들로 치환하더라도 데이터 변환 시 신뢰도 문제는 발생함
    • 원-핫 인코딩(One-hot Encoding)
      • 표현하고 싶은 범주형 변수의 인덱스에 1, 다른 인덱스에는 0을 부여하는 벡터 표현 방식
      • 장점 : 구현이 쉽고 작은 데이터셋에서 빠르게 동작
      • 단점
        • 범주가 추가되면 데이터 크기가 바뀌게 됨
        • 정보가 없는 공간에선도 관리가 필요함
        • 메모리의 낭비 발생
  • 3과목
    • 다중선형회귀분석
      • 여러 개의 독립변수(연속형)와 하나의 종속변수(연속형)의 선형관계를 모델링하기 위해 사용됨
      • 각각의 독립변수는 종속변수와 성형관계가 존재함
      • 독립변수 사이는 높은 수준의 상관관계가 존재하지 않아야 함
      • 추정된 종속변수 값과 실제 관측된 종속변수 값과의 차이(잔차)는 정규분포를 따라야 함
    • 결정계수(Coefficient of Determination, R²)
      • 1에 가까울수록 산점도에서 점들이 직선 주위에 밀집되어 나타나게 되어, 회귀에 대한 설명이 잘 됨을 의미
      • 독립 변수와 관계 없음
      • 총편차 제곱식을 활용하여 구축된 회귀분석 모형의 정확도를 평가하기 위해 사용됨
    • 인과관계 분석 (Causal Analysis)
      • 인과관계 :  선행하는 한 변수가 후 행하는 다른 변수의 윈인이 되는 관계
      • 독립변수와 종속변수 사이의 인과관계를 분석
    • 의사결정나무 분석  알고리즘
      • CHAID
        • 카이제곱(이산형 목표변수)이나 F검정(연속형 목표변수)를 이용해서 분리를 수행하는 알고리즘
        • 카이제곱 통계량이 가장 큰 예측변수를 이용해서 자식마디 형성
      • CART
        • 지니지수(Gini Index)를 이용해서 분리를 수행하는 알고리즘
          • 지니지수 
            • 0에서 1사이의 값
            • 1은 완벽한 순수의 노드
            • 각 마디에서의 불순도나 다양도 측정
      • C4.5
        • 엔트로피 지수(Entropy Index)를 이용하여 분리 및 가지치기 수행
      • Alpha-Beta 가지치기
        • 사전에 가능성이 없는 경우 가지를 미리 제거하는 방법
        • 사전에 쓸모 없는 가능성을 제거하면서 시간과 공간의 낭비를 줄임
    • 랜덤포레스트
      • 배깅 기법을 이용해 개별 의사결정 트리가 데이터 집합에서 무작위로 표본을 추출하고 데이터를 대체하여 개별 트리엣 다른 결과를 생성
        • 이 경우 각각의 트리는 사용가능한 모든 데이터를 포함하는 대신 데이터의 일부만 사용함
      • 결측치 다루기에 용이함
      • 데이터 처리에 효과적이고 모델의 정확도를 향상시킬 수 있으나, 학습을 위한 메모리 소모가 큼
      • 분류, 회귀 분석 등에 사용되는 앙상블 학습 방법의 일종
      • 훈련과정에서 구성한 다수의 결정 트리로부터 분류 또는 평균 예측치를 출력함
      • 의사결정나무 기법에서의 오버피팅 한계를 극복하기 위한 하나의 전략으로 제시됨
      • 훈련을 통해 구성한 다수의 나무들로부터 최종적인 결과를 취합하여 결론 도출
  • 4과목
    • ROC - 민감도(p) vs 특이도(c)
      • 예측력이 있는 데이터 분석모형의 경우 : 민감도(p) > 1-특이도(1-c)
      • 예측력이 없는 데이터 분석모형의 경우 : 민감도(p)=1-특이도(1-c)
      • 민감도가 증가하면 특이도 감소
      • 특이도가 증가하면 민감도 감소
      • 특이도(c) = 0.5 → 민감도(p) > 0.5
    • SERVQUAL(Service Quality, 서브퀄) 기반 서비스 품질관리 평가지표
      • 각 항목에 대한 기준을 세우고 고객의 기대와 서비스 인지에 대한 서비스 인지에 대한 서비스 품질을 관리함
        • 유형성 (물리적인 시설)
        • 신뢰성 (고객에게 약속한 서비스 준수 여부)
        • 대응성 (즉각적 응대 및 신속한 서비스 제공)
        • 확신성 (전문지식, 기술, 자격 등의 능력)
        • 공감성 (고객에 대한 배려, 관심, 맞춤형 서비스 제공 여부)
    • 비교 시각화
      • 비교 대상의 변수가 둘 이상인 경우 변숫값을 비교하며, 변수들 사이의 관계를 이해하기 위해 사용
      • 스타차트(Star Chart)
        • 각 변수의 표시 지점을 연결선을 통해 그려 별 모양으로 나타냄
        • 중심점은 축이 나타내는 값의 최솟값, 가장 먼 끝점은 최댓값
        • 독립변수가 늘어날 때마다 축이 늘어나는 비교시각화 방법
      • 체르노프 페이스 (Cherrnoff Face)
        • 데이터를 사람의 얼굴 이미지로 표현
        • 얼굴의 가로 너비, 세로 높이, 눈, 코, 입, 귀 등 각 부위를 변수로 대체해 데이터 속성을 쉽게 파악 가능
      • 평행 좌표계
        • 여러 축을 평행으로 배치하여 만듦
        • y축에서 윗부분은 최대값, 아래는 최솟값
        • 대상이 많은 데이터에 대한 집단적 경향성 파악 가능
      • 히트맵
        • 색상으로 데이터 값을 표현
        • 하나의 대상에 해당하는 하나의 행을 왼쪽에서 오른쪽(또는 하나의 열을 위에서 아래로)으로  보면서 모든 변수 파악 가능