全基因组测序WGS和全外显子组测序WES遗传变异分析 | 在线工具零代码使用教程

本教程适用于全基因组测序WGS和全外显子组测序WES的二代测序数据遗传变异分析,基于GATK(GenomeAnalysisToolkit)分析流程,可对人类双端测序FASTQ文件进行自动化处理,完成数据质控、序列比对、变异检测和结果文件输出,最终获得SNP和Indel变异结果。

工具地址:https://www.henbio.com/tooldetail?id=470
开始分析前,需要准备二代双端测序数据,即Read1文件和Read2文件。输入文件应为FASTQ格式的压缩文件,通常使用fastq.gz或fq.gz后缀。Read1和Read2必须来自同一个样本、同一个双端文库,且文件命名应能清晰对应。例如,样本sample1的双端测序文件可命名为sample1_R1.fastq.gz和sample1_R2.fastq.gz,其中R1对应Read1,R2对应Read2。

进入“全基因组/外显子遗传变异分析”工具。在“二代测序Read1文件”区域点击“选择文件”,从平台文件目录中选择对应的Read1测序文件。如果文件尚未上传,可在文件选择窗口中使用“上传”功能上传本地数据。完成Read1选择后,在“二代测序Read2文件”区域选择同一样本对应的Read2文件。若仅想体验流程,可点击“示例文件”自动加载平台提供的测试数据;如需重新选择文件,可点击“清除”删除当前已选文件。

在“测序数据类型”中根据实验类型选择WGS或WES。若数据来自全基因组测序,应选择WGS;若数据来自外显子捕获测序,应选择WES。WGS通常覆盖全基因组区域,适用于全基因组范围内的SNP和Indel检测;WES主要针对蛋白编码区及捕获区域进行测序,适用于外显子相关的变异分析。
随后在“参考基因组版本”中选择与测序数据比对时一致的人类参考基因组版本。常用参考版本包括hg19/GRCh37和hg38/GRCh38。参考基因组版本必须与项目已有比对结果、注释数据库或后续联合分析所使用的版本保持一致,否则可能导致染色体坐标不匹配、变异注释错误或不同样本结果无法直接比较。
确认样本名称、Read1文件、Read2文件、测序类型和参考基因组版本均填写正确后,点击页面下方“运行”按钮提交任务。任务提交后,平台将自动执行数据质控、接头及低质量序列处理、参考基因组比对、重复序列处理以及变异检测等流程。工具使用fastp进行原始数据质控和过滤,可处理接头序列、低质量碱基及过短序列;之后结合GATK流程完成SNP和Indel的识别与过滤。
任务完成后,系统通常输出sample1.snp.pass.vcf.gz、sample1.indel.pass.vcf.gz、sample1.snp.pass.vcf.tsv和sample1.indel.pass.vcf.tsv共4类主要结果文件。其中sample1.snp.pass.vcf.gz为通过过滤的SNP变异结果,采用压缩VCF格式保存;sample1.indel.pass.vcf.gz为通过过滤的Indel变异结果,同样采用压缩VCF格式保存。VCF文件适合用于后续变异注释、群体分析、遗传病筛查、数据库检索或生物信息学流程分析。

sample1.snp.pass.vcf.tsv为SNP结果的TSV表格文件,sample1.indel.pass.vcf.tsv为Indel结果的TSV表格文件。TSV文件可使用Excel、WPS或文本编辑器查看,更适合进行人工浏览和初步筛选。表格中通常包含染色体编号、变异位置、参考等位基因、突变等位基因、质量值、过滤状态、深度及基因型等信息。常见字段包括#CHROM、POS、REF、ALT、QUAL、FILTER、INFO和FORMAT,其中#CHROM表示染色体,POS表示变异坐标,REF表示参考碱基,ALT表示突变碱基,QUAL表示变异质量值,FILTER为PASS通常表示该变异通过过滤。
使用该工具时,应重点确认Read1和Read2是否正确配对,样本名称是否规范,以及参考基因组版本是否与实验设计一致。对于WES数据,还应注意外显子捕获区域、测序深度和覆盖度会直接影响变异检出效果;对于WGS数据,则应关注全基因组平均深度、重复率和比对率。获得变异结果后,建议结合ClinVar、dbSNP、gnomAD、OMIM等数据库开展变异注释、致病性评估和候选位点筛选。
更多推荐


所有评论(0)