Zgromadzenie transkryptomu i odkrycie genu mięsistej łodygi Cistanche Deserticola-Ⅰ

Sep 06, 2024

Tła

Cistanche Deserticola jest całkowicie niefotosyntetyzującą rośliną pasożytniczą o wielkiej wartości leczniczej i występuje głównie na pustyni w północno-zachodnich Chinach. Jej suszona, mięsista łodyga jest kluczowym tonikiemtradycyjna medycyna chińskaktórego rolą jest głównie poprawa funkcji seksualnych u mężczyzn i wzmocnienie odporności, ale przeprowadzono niewiele badań mechanistycznych, częściowo ze względu na brak zasobów genomicznych i transkryptomicznych.

Natural cistanche tubulosa

NATURALNY CISTANCHE TUBULOSA MEDYCYNA TRADYCYJNA CHIŃSKA PHGS75% ECH 30% ACT 12%

Wyniki

W tym badaniu przeprowadziliśmy głębokie sekwencjonowanie transkryptomu w mięsistej łodydze C. desericola i wygenerowano około 80 milionów odczytów przy użyciu sekwencjonowania końców par Illumina na platformie HiSeq2000. Używając asemblera Trinity, otrzymaliśmy 95 787 sekwencji transkryptów o długości transkryptu w zakresie od 200 pz do 15 698 pz, o średniej długości 950 zasad i długości N50 wynoszącej 1519 zasad. Zidentyfikowano 63 957 transkryptów wykazujących aktywną ekspresję przy FPKM większym lub równym 0,5, przy czym 30 098 transkryptów opatrzono adnotacjami z opisami genów lub terminami z ontologii genów na podstawie analiz podobieństwa sekwencji w kilku publicznych bazach danych (Uniprot, NR i Nt w NCBI i KEGG). . Ponadto zidentyfikowaliśmy kluczowe geny enzymów biorące udział w biosyntezie ligniny i glikozydów fenyloetanoidowych (PhG), o których wiadomo, że są głównymi składnikami aktywnymi. Na podstawie porównania sekwencji i analizy filogenetycznej zidentyfikowano cztery geny amoniakaliozy fenyloalaninowej (PAL), pierwszego kluczowego enzymu w biosyntezie ligniny i PhG. Po raz pierwszy zaproponowano także dwa szlaki biosyntezy PhG.

Wnioski

W sumie zakończyliśmy globalną analizę transkryptomu mięsistej łodygi C. desericola przy użyciu technologii seq RNA. Na podstawie złożonych i opatrzonych adnotacjami transkryptów zidentyfikowano zbiór genów enzymów związanych z biosyntezą ligniny i glikozydów fenyloetanoidowych, a także przewidziano rodzinę genów PAL. Dane sekwencyjne z tego badania będą stanowić cenne źródło do prowadzenia przyszłych badań nad biosyntezą glikozydów fenyloetanoidowych i badań genomiki funkcjonalnej tej ważnej rośliny leczniczej.

Wstęp

C. desericola to ogólnoświatowy rodzaj wieloletnich roślin pustynnych z rodziny Orobanchaceae, gatunek całkowicie niefotosyntetyzujący i zwykle rosnący pod ziemią roślina holopasożytnicza. Pasożytuje na korzeniach psammofitu Haloxylon ammodendron (Chenopodiaceae), który ze względu na dużą tolerancję na suszę i zasolenie zamieszkuje głównie pustynie i półpustynie. C. desericola wykazuje silną odporność na trudne warunki środowiskowe i występuje głównie w północno-zachodnich Chinach, szczególnie w Mongolii Wewnętrznej, Gansu i Xinjiangu. W ostatnich latach uznano go za gatunek zagrożony wyginięciem ze względu na zwiększone spożycie przez ludzi. C. desericola, często nazywana żeń-szeniem pustynnym, jest powszechnie znana jako rzepak pustynny, a suszona mięsista łodyga jest od wielu lat szeroko stosowana jako tradycyjnie ważny tonik w Chinach i Japonii. Został on pierwotnie zapisany w Shen Nong Ben Cao Jing (Słownik chińskiej Materia Medica, 1977) około 1800 lat temu i był uważany za jedno z głównych źródełChińskie zioło lecznicze Cistanche.

Chinese cistanche tubulosa

NATURALNY CISTANCHE TUBULOSA DLA POPRAWY FUNKCJI SEKSUALNYCH PHGS75% ECH 30% ACT 12%

Ekstrakty z C. desericola posiadają szeroki zakres funkcji leczniczych, zwłaszcza do stosowania w celu poprawy funkcji seksualnych, tonizacji nerek, ochrony wątroby, aktywności okołoporodowej, poprawy pamięci, działania immunomodulującego, przeciwutleniającego, przeciwzapalnego, przeciwwirusowego itp. głównymi bioaktywnymi składnikami C. Deserticola są glikozydy fenyloetanoidowe (PheG, PhG). Do chwili obecnej z soczystej łodygi C.deserticola wyizolowano ponad 20 glikozydów fenyloetanoidowych. Wśród nichakteozyd i echinakozydto dwa główne składniki o znaczącym działaniu farmakologicznym i są udokumentowane jako standardy jakości C. desericola w chińskiej farmakopei (wydania z 2005 i 2010 roku). Trzy składniki chemiczne PhG to kwas organiczny, sacharyd i fenyloetanoid, jednakże szczegóły dotyczące szlaków biosyntezy fenyloetanoidów u C.deserticola pozostają słabo poznane.

Pomimo komercyjnego i leczniczego znaczenia C.deserticola, dane genomiczne i transkryptomiczne tego gatunku są bardzo ograniczone. W bazie danych NCBI nie ma dostępnych EST, a pełna informacja o genomie tego gatunku pozostaje niedostępna, z wyjątkiem sekwencji genomu chloroplastów. Ograniczone dane transkryptomiczne utrudniają badanie mechanizmów biosyntezy PhG. Technologia RNA-seq może generować sekwencje ulegających ekspresji części docelowego genomu i identyfikować geny [18] przy użyciu platform technologicznych NGS (takich jak Applied Biosystems SOLiD, Illumina HiSeq i Roche 454). Staje się coraz bardziej popularna w składaniu transkryptomu de novo, ponieważ jest opłacalnym i wydajnym podejściem o wysokiej rozdzielczości i szerokim zakresie dynamiki, zwłaszcza że ma tę zaletę, że pozwala na badanie transkryptów o niskiej liczebności. Ze względu na różne zalety sekwencja RNA jest szczególnie atrakcyjna dla organizmów niemodelowych z ograniczonymi zasobami genetycznymi. Jednakże nie ma szczegółowych badań nad transkryptomem C. Deserticola na podstawie sekw. RNA.

W tym badaniu globalnie zsekwencjonowaliśmy transkryptom łodygi C. desericola przy użyciu platformy Illumina Hiseq2000 i uzyskaliśmy surowe dane 7,9G. Poprzez montaż i adnotację wydobyliśmy geny zaangażowane w biosyntezę PhG oraz geny odpowiedzialne za całą biosyntezę ligniny. Nasza analiza seq RNA wygenerowała pierwszy konsensusowy transkryptom C. desericola i dostarczyła nowych informacji na temat wszechstronnego zrozumienia wartości leczniczej C. desericola. Dodatkowo opisaną tutaj metodę można szeroko zastosować do profilowania transkryptomów, aby ułatwić odkrycie genów zaangażowanych w szlaki biosyntezy określonych składników leczniczych w innej roślinie leczniczej o bardzo ograniczonych zasobach genomowych.

Materiały i metody

Zbiór materiału roślinnego

Świeżą, soczystą łodygę C. desericola na etapie wykopalisk zebrano z bazy roślin w mieście BayanHot w lidze Alxa w Mongolii Wewnętrznej w północno-zachodnich Chinach. Pozwolenie na zbieranie uzyskano od właściciela (HongKui CongRong Group) bazy roślinnej. Próbkę kuponu zdeponowano w ośrodku Core Genomic Facility w Pekińskim Instytucie Genomiki Chińskiej Akademii Nauk. Po oczyszczeniu soczyste tkanki łodygi pocięto na małe kawałki i natychmiast zamrożono w ciekłym azocie, a następnie przechowywano w temperaturze -80 do czasu dalszego przetwarzania.

Ekstrakcja RNA, konstrukcja biblioteki cDNA i sekwencjonowanie Illumina

Całkowity RNA ekstrahowano z soczystej łodygi przy użyciu odczynnika TRIzol (Invitrogen Inc., Kalifornia, USA) zgodnie z instrukcjami producenta. Powstałe próbki traktowano DNazą I w celu usunięcia jakiegokolwiek genomowego DNA. Wyekstrahowane RNA oznaczono ilościowo za pomocą bioanalizatora Agilent 2100 (Agilent Technologies) i sprawdzono pod kątem integralności za pomocą elektroforezy w denaturującym żelu agarozowym z barwieniem bromkiem etydyny. Próbki RNA o stosunkach A260/A280 pomiędzy 1,9 a 2,1, stosunkach RNA 28S:18S wyższych niż 1,0 i liczbach integralności RNA (RIN) -8,5 wykorzystano w kolejnych analizach.

Biblioteki seq RNA wygenerowano przy użyciu zestawów do przygotowania próbek RNA Illumina Truseq. Poli(A)+ RNA wyizolowano z całkowitego RNA przy użyciu kulek Dynal Ligo(dT)25 zgodnie z instrukcjami producenta. Po oczyszczeniu dodano bufor do fragmentacji w celu rozbicia mRNA na krótkie fragmenty. Pierwszą nić cDNA zsyntetyzowano przy użyciu tych krótkich fragmentów jako matryc, wraz z odwrotną transkryptazą SuperScript III i losowym starterem heksamerowym N6. Następnie zsyntetyzowano drugą nić cDNA przy użyciu buforu, dNTP, RNazyH i polimerazy DNA I. Powstały dwuniciowy cDNA poddano naprawie końców przy użyciu polimerazy DNA T4, fragmentu Klenowa polimerazy DNA I i kinazy polinukleotydowej T4 i ligowano do adaptery wykorzystujące ligazę DNA T4. Fragmenty zligowane z adaptorami oczyszczono przy użyciu zestawu do ekstrakcji QiaQuick PCR i eluowano buforem EB. Po analizie metodą elektroforezy w żelu agarozowym wybrano odpowiednie fragmenty jako matryce do amplifikacji PCR. Sekwencjonowanie powstałej biblioteki cDNA przeprowadzono za pomocą systemu Illumina HiSeq 2000.

Składanie transkryptów de novo i ilościowe oznaczanie ekspresji genów

Surowe odczyty wygenerowane w wyniku sekwencjonowania oczyszczono poprzez usunięcie sekwencji adapterów (ATCTCGTATGCCGTC) przy użyciu metody wewnętrznej. Następnie przeprowadziliśmy rygorystyczny proces filtrowania niskiej jakości. Po pierwsze, zasady z wynikiem jakości phred niższym niż 20 zostaną odcięte od 3' końca sekwencji, aż do połączenia się z jedną zasadą o wyższej jakości (większej lub równej 20). Jeśli długość odczytu była krótsza niż 50 pz, zostałaby odrzucona. Po drugie, odczyty będą dalej filtrowane według kryterium, że 70% zasad w jednym odczycie ma wyniki wysokiej jakości (większe lub równe 20). Po trzecie, do dalszego montażu wykorzystano tylko odczyty ze sparowanych końców. Montaż transkryptu de novo przeprowadzono przy użyciu wersji Trinity_20130216 [30], która składała się z trzech kolejnych modułów oprogramowania: Inchworm, Chrysalis i Butterfly. Parametry zestawu ustawiono jak poniżej: -seqType fq-JM 300G -min_contig_length 200-CPU 20-inchworm_cpu {{21} }bflyCPU 20.

Aby określić ilościowo obfitość transkryptów, zsekwencjonowane odczyty końców par zostały ponownie dopasowane do złożonych transkryptów przy użyciu skryptu w Trinity. Zmapowane odczyty wykorzystano do oceny ilościowej za pomocą oprogramowania RSEM (RNA-Seq by Issueation Maximization). Liczebność genu lub izoformy była reprezentowana przez wartość fragmentu na kilozasad transkryptu na milion mapowanych fragmentów (FPKM), te transkrypty o wartości FPKM równej lub większej niż 0.05 zdefiniowano jako wyrażone.

Adnotacja funkcjonalna wyrażonych transkryptów

Nie ma żadnych zestawów adnotacji genów C. Deserticola z wyjątkiem genomu chloroplastów [1]. Dodaliśmy adnotacje do wyrażonych transkryptów, porównując je oddzielnie ze zbiorami danych Genbank Nt, Genbank Nr i TAIR10_ pep_20101214_zaktualizowanymi za pomocą programu BLAST (E< = 1e-20). Meanwhile, all expressed transcripts were translated into potential proteins according to ORF prediction by TransDecoder and predicated for the conserved domains based on the Pfam database.

Adnotacja Gene Ontology i szlaku KEGG Przez dopasowanie podobieństwa sekwencji do bazy danych Uniprot (adnotację Gene Ontology (GO) do wszystkich złożonych transkryptów uzyskano przy użyciu pliku asocjacji pobranego z (ftp://ftp.ebi.ac.uk/pub/ Databases/GO/goa/UNIPROT/gene_association.goa_uniprot.gz). Grupowanie wyrażonych genów w terminach GO przeprowadzono przy użyciu niestandardowych skryptów, a geny opatrzono adnotacjami na czwartym poziomie dla Kategorie CC, BP ​​i MF oddzielnie.

Informacje o szlaku KEGG przypisano do wszystkich przewidywanych sekwencji białek za pomocą narzędzia internetowego KAAS (KEGG Automatic Annotation Server) [34]. Sekwencje w formacie fasta przesłano na żądanie KAAS i pobrano powstałe pliki zawierające informacje o wszystkich szlakach związanych z transkryptomem łodygi C. desericola. Zestawy danych genów 13 organizmów roślinnych w KEGG wykorzystano do adnotacji przy użyciu metody BBH (bi-direction best hit).

cistanche tubulosa extract

NATURALNY EKSTRAKT Z CISTANCHE TUBULOSA CISTANCHE PHGS75% ECH 30% ACT 12%

Analiza RT-qPCR

Po trawieniu DNazą I, około 5 µg całkowitego RNA przekształcono w pierwszą nić cDNA poprzez reakcję odwrotnej transkrypcji ze starterami oligo(dT)15 i systemem odwrotnej transkrypcji GoScript (Promega). Produkty cDNA następnie rozcieńczono 10-krotnie dejonizowaną wodą wolną od nukleaz przed użyciem jako matrycy w PCR w czasie rzeczywistym. Specyficzne cDNA amplifikowano za pomocą systemu GoTaq 2-Step RT-qPCR (Promega) w objętości 20 ul. Amplifikację PCR przeprowadzono w temperaturze hybrydyzacji 60 stopni za pomocą systemu 7500 Real-Time PCR Detection System (Applied Biosystems) zgodnie z instrukcjami producenta. Względną liczebność transkryptów obliczono metodą porównawczą progu cyklu z genem „comp10579_c0” jako standardem wewnętrznym, przy użyciu oprogramowania 7500 Manager.

Pary starterów do RT-PCR zostały zaprojektowane w oparciu o oprogramowanie dostępne online (http://primer3.ut.ee/) i są wymienione w zestawie danych S1.

Wyniki

Sekwencjonowanie RNA i składanie transkryptomu de novo mięsistej łodygi C. desericola

Łodyga C. desericola jest od wielu lat szeroko stosowana jako tradycyjnie ważny środek wzmacniający w Chinach i Japonii. Aby uzyskać globalny przegląd ekspresji genów w mięsistej łodydze C. desericola, zebraliśmy próbki łodyg C. desericola z tej samej podstawy roślinnej, odpowiednio w 2013 i 2014 roku. Wyekstrahowano całkowite RNA i oczyszczono RNA poliA+ w celu skonstruowania bibliotek seq RNA o sparowanych końcach. Za pomocą sekwencjonowania Illumina HiSeq 2000 uzyskano 79 433 734 i 86 019 176 odczytów końców par, odpowiadających prawie 8 miliardom i 8,6 miliardom zasad sekwencji

image

platforma w próbkach z 2013-roku i 2014-roku (Tabela 1). Po usunięciu sekwencji adapterów i odfiltrowaniu odczytów o niskiej jakości (zobacz szczegóły w Metodach), 64 831 040 wysokiej jakości odczytów na końcach par w próbce 2013--letniej wykorzystano do złożenia transkryptomu de novo. Za pomocą asemblera sekwencji Trinity [30] wygenerowano 51 719 genów i 95 787 sekwencji transkryptów o długości transkryptów w zakresie od 200 bp do 15 698 bp. Średnia długość złożonych transkryptów wynosi 950 zasad, a długość N50 wynosi 1519 zasad. Liczba transkryptów o różnej długości ujawniła, że ​​57,32% złożonych transkryptów miało około 500 bp lub więcej (ryc. 1A). Wysokiej jakości odczyty końców par w próbce z 2014- roku zmapowano na złożony transkryptom. Poza tym odkryliśmy, że liczba transkryptów dla każdego złożonego genu była różna i 69% genów z jedną izoformą ulegało ekspresji, podczas gdy 31% genów wyrażało dwa lub więcej transkryptów (ryc. 1B).

Kwantyfikacja ekspresji i adnotacja funkcjonalna złożonych transkryptów

Obfitość genów lub transkryptów określono ilościowo za pomocą pakietu RSEM, w którym zsekwencjonowane odczyty ponownie dopasowano do złożonych sekwencji genów lub transkryptów za pomocą Bowtie, a te zmapowane odczyty wykorzystano do oceny ilościowej. Obliczono wartość FPKM dla każdego genu lub transkryptu i ostatecznie zidentyfikowaliśmy 63 957 i 52 857 transkryptów o aktywnej ekspresji (wartość FPKM większa lub równa 0.5) w próbkach mięsistych łodyg C. desericola w 2{{17} }13 i 2014, odpowiednio. 44 776 transkryptów (70,01% w próbie z 2013-lat, 84,71% w próbce z 2014-lat) zostało powszechnie wyrażonych w dwóch powtórzeniach, a korelacja (współczynnik korelacji Pearsona: 0,91979) danych dotyczących ich ekspresji wyniosła pokazane na rys. S1. Surowe dane dotyczące sekwencjonowania zostały przesłane do bazy danych NCBI SRA (numery dostępu: SRX857402 i SRX858938). Do dalszej analizy wykorzystaliśmy ekspresjonowane geny zidentyfikowane w próbce z 2013-roku. Informacje o adnotacjach funkcjonalnych dla wszystkich wyrażanych transkryptów uzyskano dwiema metodami. Po pierwsze, wszystkie wyrażane transkrypty dopasowano do znanych baz danych sekwencji nukleotydów (GenBank nt) i peptydów (GenBank nr i peptyd Arabidopsis) oddzielnie za pomocą algorytmu BLAST. Spośród 63 957 wyrażonych transkryptów,

image

29 220 (45,7%) opatrzono adnotacjami i wykazano homologię z sekwencjami w dowolnej z trzech przedmiotowych baz danych z wartością odcięcia E 1e-20. Tymczasem za pomocą oprogramowania TransDecoder przewidywano kandydujące regiony kodujące dla wszystkich ulegających ekspresji sekwencji transkryptów, a do wyszukiwania domeny Pfam wykorzystano najdłuższe ORF dla każdego transkryptu. W rezultacie na podstawie bazy danych Pfam dodano adnotacje do 21 358 (33,4%) transkryptów. Ogółem 30 098 (47,1%) transkryptów zostało znacząco dopasowanych do znanych genów w publicznych bazach danych, łącząc dwie powyższe metody. Pełną listę wyrażonych transkryptów z adnotacją funkcji pokazano w danych uzupełniających (zestaw danych S2).

Przeanalizowaliśmy 20 transkryptów o największej ekspresji (Tabela 2), odpowiadających 18,99% wszystkich odczytów sekwencjonowania i odkryliśmy, że większość z nich to geny odpowiadające na czynniki abiotyczne

image

bodziec stresowy. Dehydryna (DHN), klasa hydrofilowych i termostabilnych białek stresu z dużą liczbą naładowanych aminokwasów, należących do rodziny późnej embriogenezy obfitującej w grupę II (LEA), jest genem o największej ekspresji. Wykryto, że trzy różne transkrypty dehyryny (comp28713_c0_seq1/2/4) wykazują wysoką ekspresję w mięsistych łodygach, które mogą brać udział w ochronie komórek przed uszkodzeniami spowodowanymi stresem suszy. Stwierdzono również wysoką ekspresję innych genów związanych ze stresem, takich jak białko szoku cieplnego, białko związane z patogenami i metalotioneina, co może być związane z surowym środowiskiem przetrwania. Dodatkowo, niektóre geny konstytutywne, w tym gen rybosomalnego RNA 26S (comp22329_c2_seq1), białko ulegające represji auksyny/związane z uśpieniem (comp20999_c0_seq1), Czynnik rybozylacji ADP (comp20499_ c0_seq1) również podlegał silnej transkrypcji.

Cistanche tubulosa extract

NATURALNY CISTANCHE TUBULOSA DLA POPRAWY ODPORNOŚCI PHGS75% ECH 30% ACT 12%

drk-green-rounded-corner-button-buy-now-web


Może ci się spodobać również