co-code 님의 블로그

제 2회 기출 복원 문제 오답 정리 본문

빅분기 공부

제 2회 기출 복원 문제 오답 정리

co-code 2026. 7. 30. 22:16
  • 1과목
    • 개인정보보호법
      • 개인정보 : 신분관계, 내면의 비밀, 심신의 상태, 사회 경력, 경제 관계, 기타 생체 인식 정보, 위치 정보 등
      • 개인정보 처리자의 의무사항
        • 개인 정보의 수집, 이용 및 재공, 관리(보관), 파기
  • 2과목
    • 상관계수 (r)
      • 두 개의 연속형 변수에 대해 두 변수 간에 관계가 있는지, 어떤 관계가 있는지 알아보기 위해 사용
      • [-1,1]의 범위를 가짐
        • r>0 : 양의 상관관계
        • r<0 : 음의 상관관계
        • r=0 : 두 변수 사이의 선형적 관계가 없다
    • 병렬 차트
      • 여러 범주의 데이터를 비교하기 위해 사용
      • 차원을 행, 측정값을 열에 배치하거나 그 반대로 배치하여 차트 제작
      • 그룹화된 막대 형식(병렬 막대 차트)으로 표현되기도 함
    • 층화 표본 추출 방법
      • 모집단을 둘 이상의 층으로 나누고 각 층마다 독립적으로 단순 임의 추출
      • 집단 내 동질적, 집단 간 이질적 (↔ 집락 추출법)
    • 가설 검정의 오류
      • 제 1종 오류
        • 귀무가설이 참인데 귀무가설 기각
        • 유의 수준 (α)
      • 제 2종 오류
        • 대립가설이 참인데 대립가설 기각 (귀무가설이 거짓인데 귀무가설 채택)
  • 3과목
    • 빅데이터 분석 모델링 절차 : 데이터 분할 → 데이터 모델링 → 모델 적용 및 운영 방안 마련 → 모델 평가 → 모델 검증
    • 인공신경망 하이퍼 파라미터
      • 가중치의 초기값, 학습률, 손실함수, 훈련 반복 횟수
        • 가중치, 편향 : 역전파 알고리즘 등을 통해 개선되는 파라미터
    • 다차원 척도법(MDS)
      • 유사성(or 비유사성)을 저차원의 공간에 기하학적으로 나타내어 글들의 관계를 탐색적으로 분석하고 이를 저차원의 현상 공간(Configuration Space)에 표현하는 다변량 분석 기법
      • 계량형 척도(양적 자료)의 경우 스펙트럼 분해(Spectral Decomposition)방법으로 차원 축소
    • 베이지안 기법을 이용한 P(B|X) = P(B)P(X|B)/{P(A)P(X|A)+P(B)P(X|B)}
    • 그래프 분석(Graph Analysis) : 기업 내에 축적되는 트랜잭션 데이터를 분석하기 위하여 사용
      • 트랜잭션 데이터
        • 형식 : 이벤트 ID, 발생 시각, 이벤트 속성 값, 이벤트에 포함된 개체 등
        • 기업 내 OLTP 시스템으로부터 발생
        • 그래프 모델링 과정을 거쳐 그래프 데이터로 변환 가능
    • 배깅(Bagging) VS 부스팅(Boosting)
      • 배깅(Bagging : Bootstrap Aggregation) 
        • 샘플을 여러번 뽑아 (Bootstrap) 각 모델을 학습시켜 결과물을 집계(Aggregation)
        • EX) 랜덤 포레스트
      • 부스팅(Boosting)
        • 가중치를 활용하여 약 분류기를 강 분류기로 만드는 방법
        • EX) AdaBoost, XGBoost, Arc-x4
        • Stacking(or Meta Modeling) : 서로 다른 모델들을 조합해 최고의 성능을 내는 모델 선정 방법
    • 랜덤포레스트 (RandomForest)
      • Decision Tree들을 엮어서 Forest를 만듦으로써 더 좋은 예측을 하는 기법
      • Decision Tree 셍성 방법을 이용하여 이들의 결과를 Majority Voting 등의 방법으로 종합
      • 알고리즘이 비교적 단순하며, 과적합의 가능성이 낮다.
      • Decision Tree를 만들기 위한 Memory 사용량이 많고 학습 데이터의 양이 증가한다고 해도 성능이 급격하게 향상되지는 않음
  • 4과목
    • 선형 회귀
      • 회귀식의 유의성 검정을 위하여 단순선형회귀 분석모형의 경우 t 분포, 여러개의 독립변수에 대한 다중선형회귀 분석모형의 경우 F 분포 이용
      • 독립변수와 종속변수가 각각 1개인 경우 단순선형회귀분석
      • 회귀분석모형에 대한 가설 검정을 우이한 귀무가설을 일반적으로 '설정된 회귀모형은 타당하지 않다 (유의하지 않다)'로 설정
    • 혼동 행렬
      • 민감도(Recall, Sensitivity) = TP/(TP + FP) : 긍정인 범주 중 긍정으로 올바르게 예측한 비율
      • 정밀도(Precision) = TP?(TP+FN)
      • 특이도
        • 부정인 범주 중 부정으로 올바르게 예측한 비율
        • 1-특이도(거짓 긍정률 : FPR) : 부정인 범주 중 긍정으로 잘못 예측한 비율
    • 회귀분석모향 구축시 잔차(Residual)의 가정
      • 등분산성, 독립성, 정규성(정상성)
    • 홀드아웃 vs K-Fold
      • 홀드 아웃
        • 훈련 집합(Train Set) 이용하여 분석 모형 구축
        • 시험 집합(Test Set) 이용하여 성능 평가
      • K-Fold
        •  데이터 집합을 무작위로 동일한 크기를 갖는 K개의 부분집합으로 나누고, 그 중 1개를 시험집합(Test Set)으로, 나머지 K-1개를 훈련집합(Train Set)으로 설정하여 분석 모형 평가
    • 빅데이터 분석 모형의 평가
      • 편향과 분산은 한쪽이 증가하면 다른 한쪽이 감소하고, 한쪽이 감소하면 다른 한쪽이 증가하는 경향이 있으므로 훈련이 적절하게 되어있고 편향과 분산이 적정한 값을 유지하는 분석모형을 설계하는 것이 바람직
      • 데이터 분석 모형의 예측값들의 분산은 예측값들 평균 차이의 제곱의 평균으로 구한다.
      • 데이터 분석 모형의 예측값들의 평균과 실제 정답값의 차이를 편향(Bias)
      • 예측값들의 정답이 멀리 떨어져 있으면 결과의 편향이 높다고 하고, 예측값들이 자기들끼리 멀리 흩어져 있으면 분산이 높다고 함