ChIP-Seq即染色质免疫共沉淀测序,是解析转录因子、组蛋白修饰等蛋白与基因组DNA互作关系的核心测序技术,本ChIP-Seq分析流程仅需上传原始测序fastq.gz数据、填写配套样本信息文件,完成参数配置后即可一键运行完整分析,从原始数据质控、序列比对、富集峰鉴定到峰功能注释、基序富集全套结果自动产出,适配人、小鼠、大鼠三类模式物种数据。

工具地址:https://www.henbio.com/tooldetail?id=296

前期数据与文件准备 

正式运行分析前需要提前准备两类核心文件与测序原始数据,第一类是样本描述表格文件,该表格固定三列表头,分别为SampleId、Read1、Read2,SampleId为自定义无特殊符号的样本名称,Read1、Read2对应双端测序R1、R2端fastq.gz文件名,所有测序文件名称需和表格内文本完全一致,无颠倒、错字,可在Excel中整理完成后复制粘贴至平台表格输入框;第二类是IP和Input样本分组信息文件,表格固定三列表头group_name、IP_sample、Input_sample,group_name为实验组名称,IP_sample列填写免疫沉淀处理的样本名,Input_sample列填写对应对照组Input样本名,两列样本名称必须和样本描述文件内SampleId完全匹配,IP样本为富集目标蛋白结合DNA的测序数据,Input为免疫沉淀前全基因组DNA对照数据,用于后续富集峰背景校正。同时所有测序fastq.gz原始文件需要统一存放至平台同一目录下。

平台测序数据目录上传操作 

进入ChIP-Seq分析工具页面后先完成测序数据上传,点击页面内测序数据目录对应的选择目录按钮,在弹出的文件管理窗口中点击新建文件夹,输入自定义文件夹名称后确认,双击进入新建文件夹,点击上传按钮将所有fastq.gz测序文件批量上传至该文件夹内,上传完成后返回上级目录,选中存放测序数据的文件夹并点击选择,完成测序文件目录绑定。

样本信息文件录入与绑定 

在参数设置区域第一栏样本描述文件处,将提前整理完成的SampleId、Read1、Read2三列表格信息完整粘贴至页面内置表格,表格内*标记表头为必填项,单元格标红代表信息缺失、标橙代表格式错误,粘贴完成核对四组样本信息无报错后,点击选择目录按钮选中此前上传测序文件的文件夹,完成样本与测序文件路径关联;随后处理IP和Input样本信息栏,点击选择文件按钮,上传提前制作完成的分组表格文件,也可点击示例文件下载平台标准模板对照制作,上传后系统自动读取分组对应关系,核对每组IP样本与Input对照匹配无误后进入下一步参数设置。

核心分析参数配置说明

页面内带*标记参数均为必填项,第一处峰类型参数包含narrow与broad两个选项,当实验目标为转录因子结合ChIP数据时选择narrow,目标为组蛋白修饰类宽峰数据时选择broad,平台默认参数为narrow;第二处物种名称下拉菜单可选人(Homo sapiens)、小鼠(Mus musculus)、大鼠(Rattus norvegicus),根据测序样本来源物种选择对应条目,暂无收录物种可联系平台技术支持适配;第三处macs2识别富集峰使用的统计方法包含pvalue、qvalue两种,平台默认pvalue,qvalue代表校正后p值,可根据研究严谨性需求切换;第四处显著性阈值默认数值0.05,统计学常规阈值标准,若需要降低假阳性富集峰可修改为0.01,数值仅支持0至1区间小数。

分析结果下载与内容解读

运行后,任务状态显示运行成功,进入我的项目对应任务条目,点击下载按钮获取CHIP_Seq_result.tar.gz压缩包,解压后生成分层结果文件夹:

01.QualityControl为原始数据质控文件夹,包含fastp处理前后测序指标统计表、碱基分布、测序质量分布可视化图、多质控汇总html报告,可用于评估测序原始数据合格程度;

02.Mapping为序列比对结果文件夹,包含样本比对率统计表、TSS上下游3kb区域信号分布热图、BigWig信号文件,BigWig文件可导入IGV基因组浏览器进行单基因位点可视化查看;

03.CallPeaks为macs2富集峰鉴定结果,输出峰坐标bed文件、峰长度、富集倍数、显著性数值统计表,是后续下游分析核心文件;

04.PeaksAnnotation为富集峰功能注释文件夹,产出峰在染色体分布柱状图、基因组功能元件占比饼图,直观展示富集峰在启动子、外显子、内含子等区域的分布情况;

05.findMotifs为基序富集分析文件夹,输出已知基序、从头预测基序富集图谱与统计表格,用于挖掘目标蛋白保守结合DNA序列。

Logo

一站式 AI 云服务平台

更多推荐