# Genomic Structural Variants (Genomic_Structural_Variants) Genomic Structural Variants(SVs)은 게놈의 대규모 재배열로, 일반적으로 50bp 이상을 포함하는 구조적 변화를 가리킨다. 이러한 변이는 유전자 용량의 변화, 유전자 구조의 재배치, 새로운 접합 부위의 형성 등을 초래할 수 있으며, 질환의 발생과 다양한 생물학적 현상에 중요한 역할을 한다. SVs는 염색체의 전반적 조직과 기능에 영향을 미치며, 짧은 변이(SNVs)나 인덱스형 변이와 달리 파편적이거나 다수의 유전자를 포함하는 경우가 많다. - 주요 용어: Structural Variant(SV), Copy Number Variation(CNV), Deletion(DEL), Duplication(DUP), Inversion(INV), Translocation(TRA), Insertion(INS), Balanced SV, Unbalanced SV - 길이 기준: 일반적으로 50bp 이상인 재배치를 SV로 분류한다. 이보다 작은 것은 주로 인덱스 변이로 간주되기도 하지만 연구 현장에서는 경계가 다르게 정의되기도 한다. --- ## 정의와 분류 - 정의: Structural Variant(SV)은 DNAs의 대규모 재배열을 의미하며, 염색체의 구조를 바꿀 수 있는 여러 형태를 포함한다. SV는 정면의 염기서열 변화뿐 아니라 염색체 간의 재배치도 포함한다. - 대표적 SV 유형 - Deletion(DEL): 특정 구간의 결실 - Duplication(DUP): 구간의 중복으로 인한 반복 - Inversion(INV): 구간의 방향 반전 - Translocation(TRA): 서로 다른 염색체 간의 거치 재배치 - Insertion(INS): 새로운 염기서열의 삽입 - Copy Number Variation(CNV): 염색체 구간의 전체 복사 수 변화 - Complex SV: 여러 유형이 한 번의 재배열로 함께 나타나는 경우 - 기능적 차원 - Balanced SV: 염색체의 총 복사 수가 변하지 않는 경우(INV, TRA 등) - Unbalanced SV: 염색체의 총 복사 수가 변하는 경우(DEL, DUP, 일부 INS 등) - 표기 예시 - HGVS 스타일(개별 좌표 표기 예시): chr1:g.100000_100500del, chr2:g.200000_201000dup, chr3:g.300000_300900inv - 전형적 전좌 표기(전좌/재배치): t(3;7)(q29;q31) - 삽입 예시: chr4:g.150000_150001insATG… - 수식적 표현 - Copy number 변화의 크기: ΔCN = CN_variant − CN_reference - 특정 변이의 대역 비율(대립형 비율의 간략화 표현): VAF ≈ $\\frac{N_{alt}}{N_{total}}$ --- ## 메커니즘과 형성 원리 - NAHR(Non-allelic Homologous Recombination): 중복된 서열이 존재하는 영역에서 잘못된 재조합이 발생해 SV를 유발 - NHEJ(Non-Homologous End Joining) 및 MMEJ(Microhomology-Mediated End Joining): 이음매가 일어나며 재배치를 촉진 - FoSTeS/Replicative Mechanisms: 복제 과정 중 잘못된 프루닝으로 다중 수준의 재배치를 형성 - 반복 서열 및 트랜스포저 요소: 라벨링된 재배치의 주요 촉매 - 임상적 의의: 특정 SV는 유전자 용량의 변화로 질환의 원인이 되거나, 암에서 종양 이질성의 기여자로 작용할 수 있다 --- ## 탐지 및 서술 기술 - 전통적 기술 - Karyotyping(G-banding): 큰 재배열 탐지, 해상도 제한 - Array-based 기술: aCGH, SNP array 등으로 염색체의 복사 수 변화를 탐지 - FISH( Fluorescence In Situ Hybridization): 특정 구간의 위치와 구조를 확인 - 시퀀싱 기반 기술 - Short-read WGS: 균일한 커버리지에서 이상 구조를 탐지 - Long-read WGS(PacBio, Oxford Nanopore): 높은 연속성으로 정확한 Breakpoint 해상도를 제공 - 10x Genomics Linked-Reads, Hi-C: 장거리 연관 정보로 복잡 구조의 해석에 도움 - Optical Mapping: 큰 구간의 구조를 직접 시각화 - 탐지 알고리즘 및 전략 - Read-depth(리드 깊이) 기반: CNV/구간 복사 수 변화 탐지 - Discordant read-pair: 예외적으로 방향/거리 차이가 나는 페어를 탐지 - Split-read: 한 읽기가 두 개의 위치를 부분적으로 매핑하는 경우breakpoint 해상도 확보 - Assembly-based 및 Graph-based 방법: 복잡 구조에서 독립적 재구성으로 SV를 포착 - 통합 접근: 여러 신호를 결합한 다중 모달 탐지 도구 사용 - 검증 및 해석 - PCR, Sanger sequencing, FISH를 통한 벤치마킹 - 가족 기반 분석(Family-based SV 추적)과 임상 기록의 상관 분석 - 해석의 한계: 반복 영역, 다중 구조, 균주 간 차이, 체세포 이종성 등으로 인한 오탐/미탐 가능 - 도구 예시 - DELLY, MANTA, LUMPY, GRIDSS, SvABA, Svim(롱리드용), Sniffles, cuteSV, PBSV 등 - 각 도구의 강점과 한계: 짧은 리드에 강한 도구 vs 롱리드에 최적화된 도구 --- ## 표기법, 데이터 표준화 및 해석의 도전 - 표준화의 필요성: SV의 경계, 경계 해상도, 표기법은 연구자 간 비교에 큰 영향을 미친다 - HGVS 및 RESTful 포맷과의 연계: SV의 좌표 표기는 g., chr 기반 표기, 또는 전통적 karyotype 표기로도 표현 가능 - 해석의 난제: 많은 SV가 비병적(benign)으로 존재하나, 질환 관련 SV의 임상적 해석은 용량 민감도, 위치적 중요성, 다른 유전자와의 상호작용 등에 좌우된다 - 데이터 표현의 예: - ΔCN = CN_variant − CN_reference으로 복사 수 변화의 크기를 수치화 - VAF ≈ $\\frac{N_{alt}}{N_{total}}$를 통해 대립형 비율의 개략적 추정 --- ## 임상적 의의와 응용 - 질환 연관성 - 발달장애, 신경발달장애, 다형성 질환, 면역계 관련 질환 등에서 SV가 중요한 기여 요인으로 작용 - 암에서 종양의 이질성, 전이성 특성, 치료 반응성 및 예후 예측에 영향 - 진단 및 치료 구현 - 정확한 SV 식별은 진단 확정, 예후 예측, 표적 치료 전략의 결정에 기여 - 가족 기반 분석 및 재현성 있는 벤치마크로 개인 맞춤 의학에 활용 - 해석의 한계와 고려사항 - 반복 배치 영역에서의 탐지 한계 - 다발성 SV의 동시 존재 및 상호작용의 복잡성 - 해석의 표준화 부족으로 인한 임상적 결정의 일관성 문제 --- ## 데이터베이스와 도구 생태계 - 데이터베이스 - dbVar: 전 세계 SV 데이터베이스, 벤치마크 및 주석 - DGV(Database of Genomic Variants): 일반 인구에서의 SV 관찰 정보 - ClinVar: 질환과의 임상적 연관성 주석 - gnomAD-SV: 인구 기반 SV 주석 및 대조 정보 - 도구/리소스 - SV 탐지 도구: DELLY, MANTA, LUMPY, GRIDSS, SvABA - 롱리드용 도구: Sniffles, SVIM, cuteSV, PBSV - 보완적 방법: 10x Genomics Linked-Reads, Hi-C 기반 분석, Optical Mapping - 표준화 및 주석 도구: HGVS 변환, 주석 파이프라인, 벤치마크 데이터셋 --- ## 연구·임상 현장의 실무 가이드 - SV 탐지 파이프라인 설계 - 샘플 준비의 품질 관리: DNA 농도, 생물학적 복제 - 적절한 시퀀싱 전략 선택: 짧은 리드 vs 롱리드, 커버리지 목표 - 다중 신호 융합: read-depth, discordant pairs, split-reads, 어셈블리 기반 신호를 종합 - 벤치마크 및 검증: 독립적 검증 방법으로 결과의 신뢰성 확보 - 해석 및 임상 보고 - 임상적 중요도 분류: 병후성, 과용량성, 생식선 전달 가능성 등 - 가족력 및 표현형과의 연계 분석 - 보고 형식: SV의 좌표, 유형, 크기, 해석 및 한계, 필요한 추가 검증 권고 --- ## 앞으로의 방향 - 표준화 및 자동화의 확산: SV 탐지의 재현성 향상과 비교 가능한 포맷의 확립 - 다중 모달 데이터 융합: WGS, 롱리드, Hi-C, 시퀀스 기반 주석의 상호 보완 - 임상 적용의 확대: 종양학, 신경발달장애, 생식력 분야에서의 원인 규명 및 맞춤 치료의 발전 - 벤치마크 데이터와 시나리오의 증가: 공개 데이터셭의 품질 개선 및 표준화된 평가 지표 --- ## 참고 및 설명용 예시 - 예시 1: Deletion 표기 - chr1:g.100000_100500del - 예시 2: Duplication 표기 - chr2:g.200000_201000dup - 예시 3: Inversion 표기 - chr3:g.300000_300900inv - 예시 4: Translocation 표기 - t(3;7)(q29;q31) --- 관련 문서: [[CNV]], [[Long_Read_Sequencing]]