co-code 님의 블로그

분석 모형 설계 오답 개념 정리 본문

빅분기 공부/3과목

분석 모형 설계 오답 개념 정리

co-code 2026. 7. 16. 23:57
  • 판별 분석
    • 사용되는 집단 변수는 범주형 변수, 판별 변수는 연속형 변수 or 범주형 변수
    • 판별 함수의 수 ≤ min( (집단 수 - 1), 판별 변수의 수)
    • 판별 분석 위해 사용한 개체들은 다변량 정규 분포이어야 한다는 가정 필요
    • 한별함수를 만든 후에 판별함수에 새로운 개체 특성을 대입하여 어떤 집단에 속할지 결정하는 것
  • Clustering(군집 분석)
    • 가장 흔히 사용되는 Clustering 기법은 K-means
    • Hierarchical Clustering(계층적 군집 분석)은  Clustering을 먼저 수행 한 후 집단 개수 설정비
    • Nonhierarchical Clustering(비계층적 군집 분석) ⊃ K-medoids
    • 각 개체간의 유사도 혹은 비유사도를 기반을 그룹에 할당하여 분석하는 기법
  • R에서 데이터 마트 구축에 사용되는 패키지
      • reshape
        • melt()와 cast()를 이용해서 데이터를 재구성히거나 재정렬
          • melt()
            • 선택한 id 변수를 이용해서 나머지 변수들을 variable이라는 이름의 데이털로 만듦
            • 모델링할 떄 유용
          • cast()
            • 원하는 형태와 함수를 이용해 데이터 요약
            • 그대프를 시각화할 떄 적합
      • sqldf
        • step 1. SQL명령이 주어지면 자동으로 스키마 생성
        • step 2. 데이터를 테이블로 로드한 후 SQL문 수행
        • step 3. SQL 실행 결과를 다시 R로 로드
      • plyr
        • 두개 이상의 데이터 프레임을 병합하거나 분리해서 요약하고, 집계할 때 사용되는 패키지
        • 데이터를 분리하고 처리한 다음 다시 결합
        • 한꺼번에 여러 개의 통계치를 구할 수 있음
  • NoSQL DBMS의 특징
    • RDMS와 비교하여 상대적으로 제한이 덜한 데이터 모델
    • Key-value, Column-oriented, Document-oriented, Graph-oriented 등의 모델링 기법 가능
    • 두 개체의 관계가 1:1인 경우 어느 한 쪽의 속성에 링크로 저장하거나 하나의 테이블로 통합
    • 두 개체의 관계가 1:n인 경우 Embedding 기법을 활용하여 테이블 생성
    • MongoDB의 경우 DBMS가 자동으로 생성하는 id 식별자 이용 가능