41 lines
1.5 KiB
Bash
41 lines
1.5 KiB
Bash
#!/bin/bash
|
||
|
||
set -euo pipefail
|
||
|
||
cd "$PROJECTHOME"/11.reference_v2
|
||
|
||
# HG sequences name should be changed.
|
||
cd raw
|
||
seqkit replace -k HG.map.txt -p "^(\S+).*$" -r "{kv}" GCA_030763125.1_ASM3076312v1_genomic.fna -o HG.fa -K --f-use-regexp
|
||
|
||
# MG & ZG use hapA genome
|
||
grep -Fwf MG.target.txt MG.gff > MG.target.gff
|
||
grep -Fwf ZG.target.txt ZG.gff > ZG.target.gff
|
||
|
||
# Extract CDS sequences from GFF3 files using gffread
|
||
pueue add -- gffread -g raw/HN.fa -x HN.cds.fa -y HN.pep.fa raw/HN.gff3
|
||
pueue add -- gffread -g raw/HG.fa -x HG.cds.fa -y HG.pep.fa raw/Hippophae_gyantsensis.gff
|
||
pueue add -- gffread -g raw/HS.fa -x HS.cds.fa -y HS.pep.fa raw/HS.gff3
|
||
pueue add -- gffread -g raw/YN.genome.fa -x YN.cds.fa -y YN.pep.fa raw/YN.gff3
|
||
pueue add -- gffread -g raw/ZG.genome.fa -x ZG.cds.fa -y ZG.pep.fa raw/ZG.target.gff
|
||
pueue add -- gffread -g raw/ZJ.genome.fa -x ZJ.cds.fa -y ZJ.pep.fa raw/ZJ.gff
|
||
pueue add -- gffread -g raw/ZY.fa -x ZY.cds.fa -y ZY.pep.fa raw/ZY.gff3
|
||
pueue add -- gffread -g raw/Hippophae_tibetana.genomic.fasta -x HT.cds.fa -y HT.pep.fa raw/Hippophae_tibetana.mRNA.gff
|
||
pueue add -- gffread -g raw/MG.genome.fasta -x MG.cds.fa -y MG.pep.fa raw/MG.target.gff
|
||
cp raw/EA.gff3.cds EA.cds.fa
|
||
cp raw/EM.genome.cds.fasta EM.cds.fa
|
||
cp raw/EA.gff3.pep EA.pep.fa
|
||
cp raw/EM.pep.fasta EM.pep.fa
|
||
|
||
mkdir pep
|
||
mkdir cds
|
||
mv ./*.cds.fa cds
|
||
mv ./*.pep.fa pep
|
||
|
||
cd pep
|
||
primary_transcript ./ last_dot
|
||
|
||
# EM基因命名特殊性,导致直接使用primary_transcript会出现问题,直接复制即可
|
||
cp EM.pep.fa primary_transcripts/EM.pep.fa
|
||
|