실험 데이터의 결측 표지자 유전자형을 대치하려면 분석 > 생명 과학 > 결측 표지자 대치를 선택하여 결측 표지자 대치 플랫폼을 시작합니다.
그림 7.4 결측 표지자 대치 시작 창
"열 선택"의 빨간색 삼각형 옵션에 대한 자세한 내용은 JMP 사용의 "Column Filter Menu"에서 확인하십시오.
표지자
원하는 표지자 열을 선택하고 표지자를 클릭하여 결측값을 대치할 표지자를 지정합니다.
기준
기준 변수의 각 수준에 대해 개별 보고서를 생성합니다. 기준 변수가 둘 이상 할당되면 기준 변수의 가능한 각 수준 조합에 대해 개별 보고서가 생성됩니다.
배수성
연구 중인 실험 생물체의 배수성 수준을 지정할 수 있습니다. 이 값은 반드시 짝수여야 함에 유의하십시오.
방법
이 옵션을 사용하여 결측 표지자 값의 대치 방법을 지정합니다.
– LD-kNNi(연관비편형 k 최근접 이웃 대치법) 방법을 사용하여 결측 유전자형을 대치하려면 LD-kNN을 선택합니다.
첫 번째 단계에서는 각 표지자 쌍 간의 쌍별 비교를 수행합니다. 표지자는 상관관계가 가장 높은 것부터 순서대로 정렬되며 x개의 최근접 표지자가 선택됩니다. 표지자 수(x)는 최근접 표지자 옵션에 입력한 값으로 지정됩니다. 각 표지자에 대해 이 절차가 수행됩니다. 두 번째 단계에서는 각 표본 쌍 간의 쌍별 비교를 수행합니다. 표본은 맨해튼(taxi cab) 거리를 사용하여 가장 가까운 것부터 순서대로 정렬되며 표본 수(k)는 "최근접 표본" 옵션에 입력한 값으로 지정됩니다. 각 결측 표본에 대해 가장 가까운 x개의 표지자와 가장 가까운 k개의 표본이 결정되고, 가장 가까운 표지자와 표본의 최빈값을 사용하여 결측값을 대체합니다. 결측 표지자는 가장 가까운 표지자와 표본의 최빈값을 사용하여 대치됩니다. 각 결측 표지자에 대해 이 과정이 반복됩니다.
– 각 유전자형 클래스의 빈도가 데이터에서 관측된 빈도로 설정되는 다항 분포에서 무작위 추출을 통해 결측 유전자형을 대치하려면 HWE 해제를 선택합니다.
– 각 유전자형 클래스의 빈도가 HWE(Hardy-Weinberg 평형)를 가정했을 때의 기대 빈도로 설정되는 다항 분포에서 무작위 추출을 통해 결측 유전자형을 대치하려면 HWE 설정을 선택합니다.
– 허용되는 값(0, 1, 2, ..., K) 중 하나를 무작위로 할당하려면 랜덤을 선택합니다. 이때 K는 배수성 수준입니다.
– 0과 배수성 값 사이의 지정된 정수로 결측 유전자형을 대치하려면 지정됨을 선택합니다.
최근접 표본
이 옵션을 사용하여 결측값 대치를 위한 최근접 표본 수를 지정합니다.
최근접 표지자
이 옵션을 사용하여 결측값 대치를 위한 최근접 표지자 수를 지정합니다.
난수 시드값 설정
난수 스트림을 시작할 음수가 아닌 정수를 지정하려면 이 옵션을 사용합니다. 값에 따라 알고리즘 결과가 달라집니다.
결측값 대치 값
이 옵션을 사용하여 결측값 기호가 포함된 셀에 삽입할 값을 지정합니다.
언스레드
멀티스레딩을 제한하려면 이 옵션을 사용합니다. 계산 속도를 높이려면 이 옵션을 선택 취소합니다.
대부분의 JMP 프로세스는 입력 테이블에 특정 데이터 구조가 있다고 가정합니다. JMP는 세로형 데이터 집합과 가로형 데이터 집합을 구분합니다. 세로형 데이터 테이블은 열에 표본이 있고 행에 분자 본체(예: 표지자, 유전자, 클론, 단백질 또는 대사물질)가 있는 반면, 가로형 데이터 테이블은 세로형 데이터 테이블을 전치하여 행에 표본이 있고 열에 분자 본체가 있습니다.
프로세스를 위한 입력 데이터 집합을 지정할 때 필요한 형식을 알고 있어야 합니다. 결측 표지자 대치에는 가로형 데이터 테이블이 필요합니다. "테이블" 메뉴의 "전치" 옵션을 사용하면 데이터 테이블을 세로형과 가로형 간에 변환할 수 있습니다.
표지자 데이터는 한 열에 숫자 형식으로 인코딩되어야 합니다. 일반적으로 이 형식을 사용하면 가장 흔하지 않은 대립유전자(마이너 대립유전자)에 대한 동형접합 이배체 개체는 테이블에서 2로 표시되고, 이형접합체는 1로 표시됩니다. 가장 흔한 대립유전자에 대한 동형접합체는 0으로 표시됩니다.