# Whole Genome Sequencing (WGS) Whole Genome Sequencing(WGS)은 생물의 전체 게놈 DNA를 고해상도로 해독하는 연구 및 진단 기술이다. 하나의 샘플에서 유전 정보를 포괄적으로 얻을 수 있어, 질환의 원인 유전자를 찾고, 진화적 관계를 추정하며, 개체 간 유전적 차이를 분석하는 데 활용된다. WGS는 짧은 읽기(short-read) 시퀀싱과 긴 읽기(long-read) 시퀀싱 두 가지 접근법으로 수행되며, 데이터 처리 파이프라인과 해석 전략에 따라 다양한 응용분야에서 활용된다. --- ## 1. 정의와 의의 - 정의: Whole Genome Sequencing은 생물의 전체 게놈을 커버리지 깊이(depth)와 정확도(quality) 기준에 맞춰 읽고, 이를 바탕으로 서열을 재구성하거나 참조 게놈과의 비교를 통해 변이와 구조적 특징을 파악하는 기술이다. - 의의: - 유전체 전체를 대상으로 한 변이 탐지: 단일염기 다형성(SNV), 작은 인델(Indel), 구조변이(SV: 대발현 변이, 균열, 재배열 등)까지 포괄적으로 탐지 가능. - 표적 재배열이나 표준화된 패널 없이도 모든 코돈 및 비코돈 영역을 포함한 정보를 확보. - 연구와 임상 간의 연결 고리: 암, 신경계 질환, 대사 질환 등 다양한 질환의 병인유전자나 예후 인자를 찾는 데 기여. - 인구유전체학 및 진료현장에서의 맞춤의료 구현에 필수적 데이터 소스. 용어 주의: WGS는 “전체 게놈 시퀀싱”으로 주로 번역되지만, 문맥에 따라 “전장 유전체 시퀀싱” 또는 “전유전체 시퀀싱”으로도 표현된다. 실무에서는 보통 WGS로 통일하여 사용한다. --- ## 2. 기술 원리와 역사 - 기본 원리: DNA를 분해하고 읽기 플랫폼(reading platform)을 통해 DNA 조각의 염기서열을 읽고, 이 조각(read)을 합성하거나 합성 없이 연결해(assembly) 원래의 게놈 서열로 재구성한다. - 역사적 흐름: - Sanger 시퀀싱의 한계: 큰 게놈 전체를 읽으려면 시간이 오래 걸리고 비용이 비쌌다. - 차세대 시퀀싱(NGS)의 도입으로 대용량 병렬 읽기가 가능해지며 WGS가 실용화되기 시작했다. - 짧은 읽기(short-read) 방식의 보급과 더불어, 긴 읽기(long-read) 방식의 개발로 구조변이 해석과 재조립 품질이 개선되었다. - 주요 구성 요소: - 샘플 수집 및 DNA 추출 - 라이브러리 준비: DNA 조각을 읽기 가능한 형태의 서열로 만들어주는 과정 - 시퀀싱 플랫폼: 읽기 길이, 정확도, 처리 속도에 차이가 있다. - 데이터 저장 및 해석 인프라: 대용량 데이터의 저장, 이동, 분석을 위한 컴퓨팅 자원과 도구 --- ## 3. 주요 시퀀싱 플랫폼 - Illumina 계열(Short-read, SBS: Sequencing by Synthesis) - 특징: 높은 정확도, 짧은 읽기 길이(보통 100-150 bp), 대용량 데이터 생산에 유리. - 일반적 사용처: 임상 진단 보조, 대규모 코호트 연구, 표준화된 분석 파이프라인에 적합. - Pacific Biosciences(PacBio) 계열( LONG-READ) - 특징: HiFi 읽기 등에서 높은 정확도와 비교적 길이가 긴 읽기 제공. - 장점: 구조변이 탐지 및 반복 영역 해석에 강점. - Oxford Nanopore Technologies(ONT) - 특징: 아주 긴 읽기를 실시간으로 제공 가능, 휴대형 기기부터 대형 시스템까지 다양. - 단점: 초기 정확도가 낮은 편이었으나 꾸준한 개선 중. - 플랫폼 선택 요인 - 연구 목표(정밀한 SV 해석 vs 표준 변이 탐지) - 예산 및 시설 여건 - 필요한 커버리지 및 해독 속도 - 해석 파이프라인과의 호환성 --- ## 4. 워크플로우(실험 및 분석) - 실험 워크플로우(일반적 순서) 1) 샘플 수집 및 품질 평가: 혈액, 조직, 또는 DNA 등급 평가. 2) DNA 추출 및 순도 확인: A260/A280, A260/A230 비율, 전체 DNA 양 확보. 3) 라이브러리 준비: 단편화(fragmentation), 어댑터 부착, 크기 선택. 4) 시퀀싱 수행: 플랫폼 특성에 따른 읽기 생성. 5) 데이터 관리 및 품질 관리: FASTQ 형식의 데이터 품질 점검. 6) 데이터 처리 및 해석 파이프라인 적용: 정렬(alignment), 재조립(assembly, optional), 변이 호출(v calling), 주석화(annotation). - 분석 파이프라인 기본 흐름 - Basecalling(ONT 등에서 필요) - read QC(품질 평가) - read trimming(필요시 불필요한 부분 제거) - 정렬(Reference-guided alignment) - 변이 호출(SNV/Indel, SV) - 주석화(유의미한 기능적 표지, 인체 데이터의 경우 인체유전체 데이터베이스 참조) - 해석 및 리포트 작성 - Assembly 중심의 접근 - 참조 기반(reference-guided) 재배열은 대부분의 임상 연구에서 흔함. - De novo assembly는 구조적 해석이나 참조 게놈이 부족한 종에서 유리하지만 데이터 요구량이 많고 복잡도가 증가. - 품질 관리 포인트 - 커버리지(depth)와 균일성 - Read length, Q-score, GC bias, 중복도 중점 확인 - 컨트롤 샘플 및 재현성 확인 --- ## 5. 데이터 형식과 처리 - 데이터 형식 - FASTQ: 읽기 염기서열과 품질 정보를 담은 기본 포맷 - BAM/CRAM: 정렬된 읽기 데이터를 압축·저장하는 포맷 - VCF: 변이(Call) 정보를 담는 포맷으로 SNV, Indel, SV 등의 정보를 포함 - 핵심 품질 지표 - 전체 커버리지(depth): 게놈 전체 평균 깊이와 코딩 영역의 깊이 분포 - Q30 이상 비율: 높은 품질의 염기콜링 비율 - 균일성(Uniformity): 게놈 전체에서 균일하게 읽혔는지 여부 - 중복도(duplicate rate): 불필요한 중복 reads 감소 여부 - 파이프라인 예시 도구 - 정렬: BWA, Bowtie - 변이 호출: GATK, FreeBayes - SV 탐지: Manta, Delly, Lumpy - 주석화: Ensembl VEP, ANNOVAR - 품질 평가: FastQC, MultiQC - 데이터 관리 고려사항 - 대용량 저장소, 백업 전략 - 데이터 보안과 프라이버시(특히 임상 데이터의 경우 HIPAA/국가 규정 준수) --- ## 6. 품질 관리와 표준화 - 품질 관리 체계 - 실험 단계의 표준화된 프로토콜( SOP) - 품질 점검 체크리스트 및 QC 지표 모니터링 - 외부 품질 평가(EQA) 참여 여부 - 표준화의 필요성 - 데이터 포맷, 주석화 규칙, 해석 가이드의 국제적 일치 필요 - 임상 적용 시 재현성과 신뢰성 확보 - 데이터 공유와 표준 - 연구 데이터 공유를 위한 공개 데이터베이스 사용 - 민감 정보 포함 여부에 대한 정책 준수 --- ## 7. 해석과 임상 적용 - 해석의 기본 원칙 - 변이가 인체 기능에 미치는 영향과 병인성과의 연관성 평가 - 가설적 또는 확립된 진단 표지자를 기반으로 한 해석 - 해석의 불확실성(uncertainty)과 한계 명시 - 변이 유형별 해석 포인트 - SNV/Indel: 유전적 질환의 원인 후보 변이 탐지 - SV(구조 변이): 재배열, 중복, 결손 등 대규모 변이 해석 - 반복 영역: 망가진 재배치, 삼중염색체 등 - 임상적 해석의 기준 - ACMG/AMP 가이드라인과 같은 국제적 기준의 적용 - 가족 연구, 페어링 분석, 표현형과의 연계 - 리포트 구조 - 진단 제안 및 해석 요지 - 발견된 주요 변이의 기능적 설명 및 보강 증거 - 데이터의 한계와 추가 검사 제안 - 응용 분야 - 진단 보조: 희귀질환, 재발성 질환의 원인 탐색 - 암 연구: 종양 이질성, 표적 치료 가능성 평가 - 인구유전체학: 질환 위험 요인 식별 및 예측 모델링 - 진로/법의학적 활용: 생물정보학적 증거 확보 --- ## 8. 임상적 활용과 한계 - 임상 활용의 장점 - 포괄적인 변이 탐지로 진단률 향상 가능 - 재현성 높은 데이터 제공으로 맞춤 치료 전략에 도움 - 한계와 도전 - 해석 시간과 비용 - 데이터 해석의 주관성 및 변이의 임상적 유의성 판단의 어려움 - 윤리적 문제와 데이터 보안, 개인정보 보호 필요 - 임상 적용 시 고려사항 - 적응증의 명확화(질환 특성과 시나리오에 따라 필요성 판단) - 보고서의 이해가능성(의료진과 환자 모두를 위한 명확한 해석) - 후속 검사 및 재해석 계획의 마련 --- ## 9. 비용, 시간, 인프라 측면 - 비용 구성 요소 - 샘플 준비 및 라이브러리 준비 비용 - 시퀀싱 비용(플랫폼별 차이) - 데이터 저장, 처리, 해석 인력 및 인프라 비용 - 시간 소요 - 샘플 준비에서 결과 보고까지의 총 소요 시간은 목적에 따라 차이가 있음 - 인프라 요구사항 - 고성능 컴퓨팅 자원(HPC) 또는 클라우드 기반 인프라 - 데이터 보안 및 백업 체계 - 전문적인 생물정보학 분석 인력 --- ## 10. 표준화와 데이터 관리 - 표준화 필요성 - 실험 및 분석 단계의 재현성 확보 - 데이터 형식, 주석화 규칙, 보고 포맷의 국제적 일치 - 데이터 공유와 프라이버시 - 연구 데이터는 가능한 익명화 및 동의에 따른 공유 - 임상 데이터는 법적 규제 및 기관 정책 준수 - 규정 및 정책 - 국가별 규정 차이와 국제 가이드라인의 균형 필요 --- ## 11. 미래 전망과 도입 트렌드 - 기술 발전 방향 - 더 긴 읽기, 더 높은 정확도, 실시간 분석의 확산 - 비용 효율성 개선으로 임상 현장 도입 확대 - 멀티오믹스 데이터와의 융합(유전체, 전사체, 염증체 등) - 데이터 해석의 자동화 - 인공지능 기반의 후보 변이 우선순위화 및 해석 지원 - 표준화된 리포트 자동 생성 - 임상 적용 확대 - 신속 진단, 재발성 질환의 개인맞춤 치료, 가족계 구성원에 대한 위험 예측 등 확장 --- ## 12. 용어집 및 약어 - WGS: Whole Genome Sequencing - SBS: Sequencing by Synthesis - FASTQ: 읽기 서열과 품질 정보를 담은 파일 형식 - BAM/CRAM: 정렬된 읽기 데이터를 저장하는 파일 형식 - VCF: Variant Call Format - SNV: Single Nucleotide Variant - Indel: Insertion/Deletion - SV: Structural Variant - HiFi: 고정밀 롱(read) 시퀀싱 결과 - QC: Quality Control - ACMG: American College of Medical Genetics and Genomics --- ## 관련 문서 - 임상 유전체학 입문 - 유전체 데이터 분석 파이프라인 - 구조적 변이(Structural Variant) 해석 가이드 - 개인정보 보호와 데이터 공유 정책 --- 관련 문서: [[임상 유전체학 입문]], [[유전체 데이터 분석 파이프라인]], [[구조적 변이(Structural Variant) 해석 가이드]], [[개인정보 보호와 데이터 공유 정책]]