7 比对到参考基因组输出bam文件

总目录:三阴性乳腺癌全外显子分析(wes)


接下来用 BWA mem把fastq map到参考基因组 hg38 版本。
比对结果直接通过管道传给samtools以 coordinate 进行sort处理,并输出bam格式文件,节省 I/O 时间。
因为空间问题,比对好的文件放在
/project/align/wes目录

6.1设置好下面批量比对的数据文件

kelly/wesproject/4_clean/wes目录下,也可以在align/wes目录下写完整路径

ls *1.fq.gz> 1
ls *2.fq.gz> 2
paste 1 2 > config
#vim config 写入第一列样本名,要以Tab分开
cat 1|cut -d"_" -f 2,3 1>0
paste 0 1 2 > config

6.2 比对

align/wes目录下
根据前面的经验,一次并行比对10个文件

(wes) pc@lab-pc:/home/kelly/wesproject/4_clean/wes$ cat config|head -10> config_10
INDEX=/data/bigbiosoft/GATK/resources/bundle/hg38/bwa_index/gatk_hg38
cat /home/kelly/wesproject/4_clean/wes/config10|while read id
do 
arr=($id)
sample=${arr[0]}
fq1=${arr[1]}
fq2=${arr[2]}
echo $sample $fq1 $fq2
bwa mem -t 4 -R "@RG\tID:$sample/tSM:$sample\tLB:WGS\tPL:Illumina" $INDEX /home/kelly/wesproject/4_clean/wes/$fq1 /home/kelly/wesproject/4_clean/wes/$fq2 |samtools sort -@ 4 -o $sample.bam -  &
done

注意bam命令的-R参数,不加也可以运行,但是后面的gatk时会报错,但是也有解决办法,见后面。-t 和-@是线程数


非常耗时的比对工作今天终于完成了。同时生成了sort好的bam文件。20190627

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • wes定义: 全外显子组测序,是利用目标序列捕获技术, 将全基因组编码基因外显子区域的DNA捕获并富集后,进行高通...
    凤凰_0949阅读 4,486评论 0 7
  • 生信学习笔记 转录组是测表达量 WES是测变异与否 WES数据分析 WES 全外显子测序 对SNP和indel体细...
    Vikenn阅读 497评论 0 0
  • 测序数据的输入文件为raw fastq,质控软件为fastqc 和trim_galore,通过参数设置,得到结果文...
    按着易得阅读 1,555评论 1 5
  • 前言 在前面的一系列WGS文章中,我讲述了很多基因数据分析的来龙去脉,虽然许多同学觉得很有帮助,但是却缺了一个重要...
    黄树嘉阅读 31,263评论 28 90
  • 久闻苏州有很多城市特色,姝婷第一次到苏州,便按捺不住好奇的心里,安顿好酒店便与同伴叫了辆快车去就近转转。 ...
    白丁123阅读 789评论 0 5