#!/bin/bash set -euo pipefail cd "$PROJECTHOME"/11.reference_v2 # HG sequences name should be changed. cd raw seqkit replace -k HG.map.txt -p "^(\S+).*$" -r "{kv}" GCA_030763125.1_ASM3076312v1_genomic.fna -o HG.fa -K --f-use-regexp # MG & ZG use hapA genome grep -Fwf MG.target.txt MG.gff > MG.target.gff grep -Fwf ZG.target.txt ZG.gff > ZG.target.gff # Extract CDS sequences from GFF3 files using gffread pueue add -- gffread -g raw/HN.fa -x HN.cds.fa -y HN.pep.fa raw/HN.gff3 pueue add -- gffread -g raw/HG.fa -x HG.cds.fa -y HG.pep.fa raw/Hippophae_gyantsensis.gff pueue add -- gffread -g raw/HS.fa -x HS.cds.fa -y HS.pep.fa raw/HS.gff3 pueue add -- gffread -g raw/YN.genome.fa -x YN.cds.fa -y YN.pep.fa raw/YN.gff3 pueue add -- gffread -g raw/ZG.genome.fa -x ZG.cds.fa -y ZG.pep.fa raw/ZG.target.gff pueue add -- gffread -g raw/ZJ.genome.fa -x ZJ.cds.fa -y ZJ.pep.fa raw/ZJ.gff pueue add -- gffread -g raw/ZY.fa -x ZY.cds.fa -y ZY.pep.fa raw/ZY.gff3 pueue add -- gffread -g raw/Hippophae_tibetana.genomic.fasta -x HT.cds.fa -y HT.pep.fa raw/Hippophae_tibetana.mRNA.gff pueue add -- gffread -g raw/MG.genome.fasta -x MG.cds.fa -y MG.pep.fa raw/MG.target.gff cp raw/EA.gff3.cds EA.cds.fa cp raw/EM.genome.cds.fasta EM.cds.fa cp raw/EA.gff3.pep EA.pep.fa cp raw/EM.pep.fasta EM.pep.fa mkdir pep mkdir cds mv ./*.cds.fa cds mv ./*.pep.fa pep cd pep primary_transcript ./ last_dot # EM基因命名特殊性,导致直接使用primary_transcript会出现问题,直接复制即可 cp EM.pep.fa primary_transcripts/EM.pep.fa