RNA-Seq-basert De Novo-transkriptomsamling og genoppdagelse av Cistanche Deserticola kjøttfulle stamme-Ⅰ

Jul 26, 2024

Bakgrunner

Cistanche deserticola er en fullstendig ikke-fotosyntetisk parasittisk plante med stor medisinsk verdi og er hovedsakelig distribuert i ørkenen i Nordvest-Kina. Den tørkede kjøttfulle stilken er en avgjørende styrkendetradisjonell kinesisk medisinmed roller som hovedsakelig å forbedre mannlig seksuell funksjon og styrke immunitet, men få mekanistiske studier har blitt utført delvis på grunn av mangelen på genomiske og transkriptomiske ressurser.

Natural cistanche tubulosa

NATURLIG CISTANCHE TUBULOSA KINESISK TRADISJONELL MEDISIN PHGS75% ECH 30% ACT 12%

Resultater

I denne studien utførte vi dyp transkriptomsekvensering i den kjøttfulle stammen til C. deserticola, og omtrent 80 millioner avlesninger ble generert ved bruk av Illumina-parende sekvensering på HiSeq2000-plattformen. Ved å bruke trinity assembler oppnådde vi 95 787 transkripsjonssekvenser med transkripsjonslengder fra 200 bp til 15 698 bp, med en gjennomsnittlig lengde på 950 baser og en N50-lengde på 1 519 baser. 63 957 transkripsjoner ble identifisert som aktivt uttrykt med FPKM større enn eller lik 0,5, der 30 098 transkripsjoner ble annotert med genbeskrivelser eller genontologiuttrykk ved sekvenslikhetsanalyser mot flere offentlige databaser (Uniprot, NR og Nt ved NCBI og KEGG) . Videre identifiserte vi nøkkelenzymgener involvert i biosyntesen av lignin og fenyletanoidglykosider (PhGs) som er kjent for å være de primære aktive ingrediensene. Fire phenylalanine ammonia-lyase (PAL) gener, det første nøkkelenzymet i lignin og PhG biosyntese ble identifisert basert på sekvenssammenligning og fylogenetisk analyse. To biosynteseveier for PhG-er ble også foreslått for første gang.

Konklusjoner

I alt fullførte vi en global analyse av C. deserticola kjøttfulle stammetranskriptom ved bruk av RNA-seq-teknologi. En samling enzymgener relatert til biosyntesen av lignin og fenyletanoidglykosider ble identifisert fra de sammensatte og kommenterte transkripsjonene, og genfamilien til PAL ble også forutsagt. Sekvensdataene fra denne studien vil gi en verdifull ressurs for å utføre fremtidig forskning på biosyntese av fenyletanoidglykosider og funksjonelle genomiske studier i denne viktige medisinplanten.

Introduksjon

C. deserticola er en verdensomspennende slekt av flerårige ørkenplanter fra familien Orobanchaceae og er en helt ikke-fotosyntetisk art og vokser vanligvis underjordiske holoparasitiske planter. Den er parasittert på røttene til psammophyte Haloxylon ammodendron (Chenopodiaceae), som hovedsakelig bor i ørkener og halvørkener på grunn av sin høye toleranse for tørke og saltholdighet. C. deserticola viser sterk motstand mot tøffe miljøforhold og er hovedsakelig distribuert i Nordvest-Kina, spesielt i Indre Mongolia, Gansu og Xinjiang. Den anses å være en truet villart de siste årene på grunn av økt konsum av mennesker. C. deserticola som ofte kalles ørkenginseng er vanligvis kjent som ørken-kvastrape og den tørkede kjøttfulle stilken har blitt mye brukt som en tradisjonelt viktig tonic i Kina og Japan i mange år. Det ble opprinnelig spilt inn i Shen Nong Ben Cao Jing (Dictionary of Chinese Materia Medica, 1977) for omtrent 1800 år siden og ble sett på som en av hovedkildene tilKinesisk medisinsk urt Cistanche.

Chinese cistanche tubulosa

NATURAL CISTANCHE TUBULOSA FOR FORBEDRING AV SEKSUELL FUNKSJON PHGS75% ECH 30% ACT 12%

Ekstraktene av C. deserticola har et bredt spekter av medisinske funksjoner, spesielt for bruk til å forbedre seksuell funksjon, tonifisere nyrer, beskytte leveren, aperient aktivitet, forbedre hukommelsen, immunmodulerende, antioksidativ aktivitet, anti-inflammatorisk, antiviral aktivitet, etc. de viktigste bioaktive komponentene i C. deserticola er Phenylethanoid glykosider (PheGs, PhGs). Til dags dato har mer enn 20 fenyletanoidglykosider blitt isolert fra den saftige stammen til C.deserticola. Blant dem,akteosid og echinakosider to hovedkomponenter med betydelige farmakologiske aktiviteter og er dokumentert som kvalitetsstandardene til C. deserticola i den kinesiske farmakopeen (2005- og 2010-utgavene). Tre kjemiske komponenter av PhG er organisk syre, sakkarid og fenyletanoid, men detaljene angående fenyletanoid biosyntetiske veier forblir dårlig forstått i C.deserticola.

Til tross for den kommersielle og medisinske betydningen av C.deserticola, er de genomiske og transkriptomiske dataene for denne arten svært begrenset. Det er ingen EST-er tilgjengelig i NCBI-databasen, og den fullstendige genominformasjonen for denne arten forblir utilgjengelig bortsett fra kloroplastgenomsekvensen. De begrensede transkriptomiske dataene hindrer studiet av PhG biosyntetiske mekanismer. RNA-seq-teknologi kan generere sekvenser av de uttrykte delene av det målrettede genomet og identifisere gener [18] ved hjelp av NGS-teknologiplattformene (som Applied Biosystems SOLiD, Illumina HiSeq og Roche 454). Det blir stadig mer populært i transcriptome de novo-montering, siden det er en kostnadseffektiv og kraftig tilnærming med høy oppløsning og bredt dynamisk område, spesielt siden det har en fordel å utforske transkripsjoner med lav overflod. På grunn av de ulike fordelene er RNA-seq spesielt attraktivt for ikke-modellorganismer med begrensede genetiske ressurser. Imidlertid er det ingen detaljert forskning på C. deserticola-transkriptom av RNA-seq.

I denne studien sekvenserte vi globalt stammetranskriptomet for C. deserticola ved å bruke Illumina Hiseq2000-plattformen og fikk 7,9 G rådata. Ved å sette sammen og kommentere, utvann vi genene involvert i biosyntesen av PhG og genene som er ansvarlige for hele ligninbiosyntesen. Vår RNA-seq analyse genererte det første C. deserticola konsensus transkriptomet og ga ny innsikt i en omfattende forståelse av den medisinske verdien av C. deserticola. I tillegg kan metoden som er beskrevet her brukes mye for å profilere transkriptomer for å lette oppdagelsen av gener involvert i spesifikke medisinske komponentbiosynteseveier i en annen medisinsk plante med svært begrensede genomiske ressurser.

Materialer og metoder

Innsamling av plantemateriale

Den ferske sukkulente stammen for C. deserticola i utgravningsstadiet ble samlet fra en plantebase i BayanHot City of Alxa League i Indre Mongolia i det nordvestlige Kina. Innsamlingstillatelsen ble innhentet fra eieren (HongKui CongRong Group) av plantebasen. Kupongprøven ble deponert i Core Genomic Facility ved Beijing Institute of Genomics, Chinese Academy of Sciences. Etter rengjøring ble det saftige stilkvevet kuttet i små biter og umiddelbart frosset i flytende nitrogen, og deretter lagret ved -80 grad til videre behandling.

RNA-ekstraksjon, cDNA-bibliotekkonstruksjon og Illumina-sekvensering

Totalt RNA ble ekstrahert fra den saftige stammen ved å bruke TRIzol Reagent (Invitrogen Inc., California, USA) i henhold til produsentens instruksjoner. De resulterende prøvene ble behandlet med DNase I for å fjerne eventuelt genomisk DNA. Ekstraherte RNA-er ble kvantifisert ved hjelp av en Agilent 2100 bioanalyzer (Agilent Technologies) og kontrollert for integritet ved bruk av denaturerende agarosegelelektroforese med etidiumbromidfarging. RNA-prøver med A260/A280-forhold mellom 1,9 og 2,1, RNA 28S:18S-forhold høyere enn 1,0 og RNA-integritetstall (RIN) -8.5 ble brukt i påfølgende analyser.

RNA-seq-bibliotekene ble generert ved bruk av Illumina Truseq RNA-prøvepreparasjonssett. Poly(A)+ RNA ble isolert fra totalt RNA ved å bruke Dynal ligo(dT)25 perler i henhold til produsentens instruksjoner. Etter rensing ble en fragmenteringsbuffer tilsatt for å bryte mRNA i korte fragmenter. Første-streng cDNA ble syntetisert ved å bruke disse korte fragmentene som maler, sammen med SuperScript III revers transkriptase og N6 tilfeldig heksamer primer. Andre-tråds cDNA ble deretter syntetisert ved bruk av buffer, dNTPs, RNaseH og DNA-polymerase I. Det resulterende dobbelttrådete cDNA ble utsatt for ende-reparasjon ved bruk av T4 DNA-polymerase, DNA-polymerase I Klenow-fragment og T4 polynukleotidkinase, og ligert til adaptere som bruker T4 DNA-ligase. Adaptorligerte fragmenter ble renset ved bruk av et QiaQuick PCR-ekstraksjonssett og eluert med EB-buffer. Etter analyse ved bruk av agarosegelelektroforese ble egnede fragmenter valgt som maler for PCR-amplifisering. Sekvensering av det resulterende cDNA-biblioteket ble utført med et Illumina HiSeq 2000-system.

Transkripsjoner de novo montering og genuttrykk kvantifisering

Råavlesninger generert fra sekvensering ble renset ved å fjerne adaptersekvensene (ATCTCGTATGCCGTC) ved å bruke en intern metode. Vi gjennomførte deretter en streng filtreringsprosess av lav kvalitet. For det første vil baser med en phred-kvalitetsscore lavere enn 20 trimmes fra 3'enden av sekvensen, til de kommer inn i en base med høyere kvalitet (større enn eller lik 20). Hvis leselengden var kortere enn 50 bp, ville den bli forkastet. For det andre vil lesninger filtreres ytterligere etter kriteriet om at 70 % av basene i en lesing har høykvalitetsscore (større enn eller lik 20). For det tredje ble bare avlesninger med parede ende brukt for videre montering. De novo transkripsjonssammenstillingen ble utført ved hjelp av Trinity-utgivelsen_20130216 [30] som besto av tre påfølgende programvaremoduler: Inchworm, Chrysalis og Butterfly. Monteringsparametrene ble satt som nedenfor:-seqType fq-JM 300G -min_contig_lengde 200-CPU 20-inchworm_cpu {{21} }bflyCPU 20.

For å kvantifisere transkripsjonsoverflod, ble de sekvenserte parende-avlesningene justert på nytt til de sammensatte transkripsjonene ved å bruke et skript i Trinity. Kartlagte avlesninger ble brukt for kvantifisering av RSEM (RNA-Seq by Expectation Maximization) programvare. Gen- eller isoformoverflod ble representert av fragmentet per kilobase av transkripsjon per million kartlagt fragment (FPKM), de transkripsjonene med FPKM-verdi lik eller større enn 0.05 ble definert som uttrykt.

Funksjonell merknad av uttrykte transkripsjoner

Det er ingen genanmerkningssett for C. deserticola bortsett fra kloroplastgenomet [1]. Vi kommenterte de uttrykte transkripsjonene ved å sammenligne dem med Genbank Nt, Genbank Nr og TAIR10_ pep_20101214_oppdaterte datasett separat ved å bruke BLAST-programmet (E< = 1e-20). Meanwhile, all expressed transcripts were translated into potential proteins according to ORF prediction by TransDecoder and predicated for the conserved domains based on the Pfam database.

Gene Ontology og KEGG pathway-annotering Ved sekvenslikhetstilpasning til Uniprot-databasen (Gene Ontology (GO)-annoteringen av alle sammensatte transkripsjoner ble oppnådd ved å bruke en assosiasjonsfil lastet ned fra (ftp://ftp.ebi.ac.uk/pub/ databases/GO/goa/UNIPROT/gene_goa_uniprot.gz). CC-, BP- og MF-kategoriene separat.

KEGG-veiinformasjon ble tildelt for alle forutsagte proteinsekvenser ved hjelp av online-verktøyet KAAS (KEGG Automatic Annotation Server) [34]. Sekvenser i fasta-format ble sendt til KAAS-forespørsel, og de resulterende filene med all veiinformasjon relatert til C. deserticola stammetranskriptom ble lastet ned. 13 planteorganismers gendatasett i KEGG ble brukt til annotering ved bruk av BBH-metoden (toveis best hit).

cistanche tubulosa extract

NATURLIG CISTANCHE TUBULOSA CISTANCHE EKSTRAKT PHGS75% ECH 30% ACT 12%

RT-qPCR-analyse

Etter fordøyelse med DNase I ble ca. 5 ug av totalt RNA omdannet til første-tråds cDNA via revers-transkripsjonsreaksjonen med oligo(dT)15-primere og GoScript Reverse Transcription System (Promega). cDNA-produktene ble deretter fortynnet 10-fold med nukleasefritt avionisert vann før bruk som mal i sanntids PCR. Spesifikke cDNA-er ble amplifisert av GoTaq 2-Step RT-qPCR-systemet (Promega) i et volum på 20 ul. PCR-amplifisering ble utført ved annealingstemperaturen på 60 grader med 7500 Real-Time PCR Detection System (Applied Biosystems) i henhold til produsentens instruksjoner. Relative transkripsjonsmengder ble beregnet ved hjelp av den sammenlignende syklusterskelmetoden med genet "comp10579_c0" som en intern standard, ved bruk av 7500 Manager-programvaren.

Primerpar for RT-PCR ble designet basert på nettbasert programvare (http://primer3.ut.ee/) og er oppført i S1-datasettet.

Resultater

RNA-sekvensering og de novo transkriptomsammenstilling av C. deserticola kjøttfull stamme

Stammen av C. deserticola har vært mye brukt som et tradisjonelt viktig tonic i Kina og Japan i mange år. For å få en global oversikt over genuttrykk i den kjøttfulle stammen C. deserticola, samlet vi inn C. deserticola-stammeprøver av samme plantebase i henholdsvis 2013 og 2014. Totale RNA-er ble ekstrahert og polyA+-RNA-er ble renset for å konstruere RNA-seq-biblioteker med parede ende. 79 433 734 og 86 019 176 avlesninger tilsvarer nesten 8 milliarder og 8,6 milliarder baser av sekvensen ble oppnådd ved bruk av Illumina HiSeq 2000-sekvensering

image

plattform i 2013-år og 2014-årsprøver (tabell 1). Etter fjerning av adaptersekvenser og filtrering av lesninger av lav kvalitet (se detaljer i Metoder), ble 64 831 040 høykvalitets parende-avlesninger i 2013-årsprøven brukt for de novo-transkriptomsammenstilling. Ved å bruke Trinity-sekvenssamleren [30], ble 51 719 gener og 95 787 transkripsjonssekvenser generert med transkripsjonslengder fra 200 bp til 15 698 bp. Gjennomsnittlig lengde på sammensatte transkripsjoner er 950 baser og N50-lengden er 1519 baser. Antall transkripsjoner i forskjellige lengder avslørte at 57,32% av de sammensatte transkripsjonene var omtrent 500 bp eller lengre (fig 1A). Høykvalitets par-ende-avlesninger i 2014-årsprøven ble kartlagt til det sammensatte transkriptomet. Dessuten fant vi at transkripsjonsnummeret for hvert samlet gen varierte og 69% av gener med en uttrykt isoform mens 31% av genene uttrykte to eller flere transkripsjoner (fig 1B).

Uttrykkskvantifisering og funksjonell merknad av sammensatte transkripsjoner

Gen- eller transkripsjonsoverflod ble kvantifisert ved å bruke RSEM-pakken, der de sekvenserte avlesningene ble justert på nytt til de sammensatte genene eller transkripsjonssekvensene ved bruk av Bowtie, og de kartlagte avlesningene ble brukt til kvantifisering. FPKM-verdi for hvert gen eller transkripsjon ble beregnet, og til slutt identifiserte vi 63 957 og 52 857 aktivt uttrykte transkripsjoner (FPKM-verdi større enn eller lik 0.5) i C. deserticola kjøttfulle stammeprøver i 2{{17} } henholdsvis 13 og 2014. 44 776 transkripsjoner (70,01 % i 2013-årsutvalget, 84,71 % i 2014-årsutvalget) ble ofte uttrykt i de to replikatene, og korrelasjonen (Pearson-korrelasjonskoeffisient: 0,91979) av uttrykksdataene deres var vist i S1 Fig. Rådataene for sekvensering var lastet opp til NCBI SRA-databasen (aksesjonsnummer: SRX857402 og SRX858938). Vi brukte uttrykte gener identifisert i 2013-årsprøven for videre analyse. Funksjonell merknadsinformasjon for alle uttrykte transkripsjoner ble oppnådd ved bruk av to metoder. For det første ble alle uttrykte transkripsjoner justert til kjente nukleotid- (GenBank nt) og peptidsekvensdatabaser (GenBank nr og Arabidopsis-peptid) separat ved hjelp av BLAST-algoritmen. Av 63 957 uttrykte transkripsjoner,

image

29 220 (45,7 %) ble kommentert og viste homologi til sekvenser i en av de tre fagdatabasene med E-verdi cutoff 1e-20. I mellomtiden ble kandidatkodingsregionene for alle uttrykte transkripsjonssekvenser forutsagt ved bruk av TransDecoder-programvare, og de lengste ORF-ene for hvert transkripsjon ble brukt til Pfam-domenesøk. Som et resultat ble 21 358 (33,4%) transkripsjoner kommentert basert på Pfam-databasen. Totalt sett ble 30 098 (47,1%) transkripsjoner signifikant matchet med kjente gener i de offentlige databasene ved å kombinere de to metodene ovenfor. Den komplette uttrykte transkripsjonslisten med funksjonsannotering ble vist i tilleggsdata (S2-datasett).

Vi undersøkte de 20 mest uttrykte transkripsjonene (tabell 2) tilsvarende 18,99 % av alle sekvenseringsavlesninger, og fant at de fleste av dem er gener som reagerer på abiotiske stoffer

image

stress stimulans. Dehydrin (DHN), en klasse av hydrofile og termostabile stressproteiner med et høyt antall ladede aminosyrer som tilhører Group II Late Embryogenesis Abundant (LEA)-familien, er det mest uttrykte genet. Tre forskjellige Dehyrin-transkripsjoner (komp28713_c0_seq1/2/4) ble påvist som sterkt uttrykt i kjøttfulle stengler som kan være involvert i å beskytte celler mot skade forårsaket av tørkestress. Andre stressrelaterte gener som varmesjokkprotein, patogenrelatert protein og metallothionein ble også funnet uttrykt høyt, noe som kan være relatert til dets alvorlige overlevelsesmiljø. I tillegg, noen konstitutive gener, inkludert 26S ribosomalt RNA-gen (komp22329_c2_seq1), auxin-undertrykt/dvale-assosiert protein (komp20999_c0_seq1), ADP-ribosyleringsfaktor (komp20499_ c0_seq1) ble også svært transkribert.

Cistanche tubulosa extract

NATURLIG CISTANCHE TUBULOSA FOR FORBEDRING AV IMMUNITET PHGS75% ECH 30% ACT 12%

drk-green-rounded-corner-button-buy-now-web


Du kommer kanskje også til å like