SCA(희소 성분 분석)는 고차원 데이터에서 더 작고 의미 있는 변수 부분집합에 집중함으로써 PCA(주성분 분석)를 확장합니다. SCA는 모든 변수를 포함하는 PCA와 달리 주성분에 가장 크게 기여하는 변수의 부분집합을 선택하여 해석력을 향상시킬 수 있습니다. SCA 방법은 데이터 집합에 변수는 많지만 관측값이 상대적으로 적은 유전체학, 단백질 연구, 금융 등의 분야에서 특히 유용합니다. SCA는 가장 관련성이 높은 특성을 식별하여 중복성을 줄이고, 핵심 패턴을 강조하며, 각 주성분이 고유한 인사이트를 제공하도록 합니다. 이렇게 간소화된 접근 방식을 통해 분석을 단순화하고, 계산 효율성을 향상시키며, 복잡한 데이터 집합을 더 쉽게 이해하고 해석할 수 있습니다.
이 예에서는 전립선암 환자 84명과 대조군 81명을 대상으로 하여 165개의 혈청 샘플에서 얻은 667개의 단백질 발현 수준이 포함된 단백질 유전 정보 데이터 집합에 SCA를 적용합니다. 목표는 데이터의 차원을 줄이는 동시에 두 그룹을 구별하는 핵심 단백질을 식별하는 것입니다. SCA는 분산에 가장 크게 기여하는 단백질에 초점을 맞춰 데이터 집합을 단순화함으로써 분류 및 군집화와 같은 후속 작업에 더 적합하게 만듭니다.
1. 도움말 > 샘플 데이터 폴더를 선택하고 Prostate Cancer.jmp를 엽니다.
2. 분석 > 다변량 방법 > 주성분을 선택합니다.
3. "열 선택" 목록에서 Proteins 열 그룹을 선택하고 Y, 열을 클릭합니다.
4. "방법 유형" 옵션에서 고급을 선택합니다.
참고: 추정할 성분 수는 기본적으로 "10"으로 설정되어 있습니다. 데이터의 컨텍스트와 연구 배경 지식을 바탕으로 "성분 수" 옆의 텍스트 상자에서 이 값을 수정할 수 있습니다.
참고: "결측값 대치" 옵션은 기본적으로 선택되어 있습니다. 이 옵션은 희소 성분 분석 알고리즘의 각 반복 단계에서 데이터 결측값 대치를 수행합니다. 데이터 집합에 결측값이 없다고 확신하는 경우 이 옵션을 선택 취소할 수 있습니다.
5. "특수 방법" 옵션에서 희소 성분 분석을 선택합니다.
6. 확인을 클릭합니다.
그림 4.12 희소 성분 분석 보고서
이 보고서에는 각 주성분이 설명하는 변동 비율 막대 차트와 고유값이 포함되어 있습니다. 고유값이 클수록 총 분산에 대한 기여도가 높음을 나타냅니다. 이 예에서는 성분 8의 고유값(73.72)이 가장 크며, 이는 해당 성분이 데이터의 분산 중 가장 큰 비율을 차지하고 기본 데이터 구조를 설명하는 데 가장 유용한 역할을 한다는 것을 의미합니다. 성분 1(55.46), 3(47.35), 9(37.20), 5(34.05)도 비교적 높은 고유값을 가지며, 이는 해당 성분이 데이터 집합의 변동성에 유의하게 기여한다는 것을 의미합니다. 이 성분을 모두 합치면 총 분산의 상당 부분을 차지합니다.
성분 4(31.31)와 6(28.66)은 중간 정도의 고유값을 가지며, 이는 해당 성분이 분산에 기여하는 정도가 의미는 있지만 우세하지 않음을 나타냅니다. 그러나 성분 2(16.34), 7(17.41), 10(20.43)은 가장 낮은 고유값을 보여 총 분산에 대한 기여도가 제한적임을 반영합니다. 이처럼 고유값이 작은 성분은 데이터에서 더 세부적이거나 덜 중요한 측면을 포착할 수 있습니다.
소수의 성분(특히 성분 8)에 분산이 집중된 것은 SCA가 차원을 줄이는 동시에 핵심 패턴을 찾는 데 효과적임을 보여 줍니다. SCA가 적용하는 희소성 덕분에 식별된 성분은 가장 유의한 특성에 집중하게 되고 이를 통해 해석력과 계산 효율성이 향상됩니다. 고유값이 큰 성분이 전립선암 특성과 관련된 가장 중요한 변동을 담고 있으므로 추가 분석을 위해 해당 성분을 우선적으로 고려할 수 있습니다.
7. "희소 성분 분석"의 빨간색 삼각형을 클릭하고 적재 행렬을 선택합니다.
8. "적재 행렬" 옆의 회색 표시 아이콘을 클릭합니다.
그림 4.13 희소 성분 분석 적재 행렬(일부)
적재 행렬은 도출된 주성분에 대한 원래 변수의 기여도를 나타냅니다. 적재 행렬을 사용하면 특정 변수가 지배적인 영향 또는 미미한 영향을 미치는 차원을 식별할 수 있습니다. 예를 들어 성분 8(Prin8)에서 mz4062_2282 변수의 적재 값은 약 1.05870으로, 다른 변수의 기여도보다 상당히 높습니다. 이는 mz4062_2282가 성분 8이 차지하는 분산을 설명하는 데 지배적인 변수임을 나타냅니다. 마찬가지로 Prin10에서 mz2084_8335 변수의 적재 값은 0.54957로, 이 성분에 상당한 영향을 미친다는 것을 나타냅니다.
또한 적재 값이 0에 가까운 변수는 주성분이 설명하는 분산에 최소한으로 기여합니다. 예를 들어 mz2011_6397 변수는 모든 주성분에서 적재 값이 0이며, 이는 해당 변수가 모형이 포착하는 분산에 유의하게 기여하지 않음을 나타냅니다. 이를 통해 변수 중요도 또는 잠재적 중복성에 대한 결론을 내리는 데 필요한 정보를 알아낼 수 있습니다.