Мини-обзор
Анализ особенностей генома бактерии Sphingomonas taxi
Екатеренчук А. А. | Факультет биоинженерии и биоинформатики МГУ им. М.В.Ломоносова
Аннотация
В данной работе представлен анализ особенностей генома бактерии Sphingomonas taxi с помощью базовых инструментов биоинформатики.
Введение
Sphingomonas taxi — это грамотрицательная бактерия семейства Sphingomonadaceae, выделенная в качестве эндофита из корневой ткани растений. Он является типичным представителем бактерий-ассоциантов растений и изучается в контексте биоремедиации.
Таксономическое положение организма:
- Domain: Bacteria
- Kingdom: Pseudomonadati
- Phylum: Pseudomonadota (proteobacteria)
- Class: Alphaproteobacteria (a-proteobacteria)
- Order: Sphingomonadales
- Family: Sphingomonadaceae (alpha-4 proteobacteria)
- Genus: Sphingomonas
- Species: Sphingomonas taxi
К ключевым особенностям Sphingomonas taxi, изученным в немногочисленных исследованиях, относятся способность к деградации стойкого органического загрязнителя ДДЭ (2,2-бис(п-хлорфенил)-1,1-дихлорэтилена) и комплекс ростостимулирующих свойств по отношению к растениям (активность АЦК-дезаминазы, продукция сидерофоров и ауксинов, солюбилизация фосфатов) [1]. Благодаря этим особенностям данный микроорганизм представляет значительный интерес для фундаментальной науки в области микробной деградации ксенобиотиков и микробно-растительных взаимодействий и имеет важное практическое значение для экологии и биотехнологии, а именно для разработки методов фиторемедиации загрязнённых почв.
Данная работа посвящена анализу генома Sphingomonas taxi с целью выявления уникальных особенностей организации данной бактерии.
Материалы
Геномные данные S. taxi были взяты с сайта NCBI [I]. Их дальнейший анализ проводился с использованием инструментария электронных таблиц (построение диаграмм и работа с таблицей особенностей генома), командной оболочки BASH (работа с файлами), скриптов, написанных на языке Python (анализ последовательностей генома).
Методы
Задание 3.1. Гистограмма длин белков
Для каждого гена длина соответствующего белка рассчитывалась по формуле:
Длина белка (аминокислот) = (Длина нуклеотидной последовательности (п.н.) ÷ 3) - 1 (стоп-кодон)
Обоснование: В стандартном генетическом коде каждый кодон (триплет нуклеотидов) кодирует одну аминокислоту, что позволяет точно определить длину белка по длине кодирующей последовательности.
Классификация белков по длине:
- Короткие белки: < 100 аминокислот
- Белки средней длины: 100-350 аминокислот
- Длинные белки: > 350 аминокислот
Построение гистограммы
Рис. 1. Гистограмма длин белков. Ось X — диапазон длин белков в аминокислотах. Ось Y — количество белков в этом диапазоне.
В основном у изучаемой бактерии белки малой и средней длины, что в целом характерно для прокариотического организма.
Задание 3.2. Определение всех стоп-кодонов
Для анализа использовались кодирующие последовательности (CDS) генома Sphingomonas taxi, полученные из аннотированного файла в формате FASTA [II]. Каждая запись в файле содержала заголовок с метаинформацией и нуклеотидную последовательность гена.
Всего было проанализировано: 3721 кодирующая последовательность, из которых:
- 16 исключены как частичные последовательности
- 4 исключены из-за некорректной длины
- 0 последовательностей имели неканонические стоп-кодоны
- 3701 последовательность прошла все фильтры
Задание 3.3. Гистограмма GC-состава по CDS
Для каждой кодирующей последовательности рассчитывался процент содержания гуанина (G) и цитозина (C) относительно общего числа нуклеотидов:
%GC = ((количество G + количество C) / общая длина последовательности) × 100%
Классификация последовательностей по GC-составу:
- GC-бедные: %GC < 60%
- GC-средние: %GC от 60% до 76%
- GC-богатые: %GC > 76%
Рис. 2. Гистограмма зависимости количества последовательностей от содержания GC-пар. Ось X — процент содержания GC-пар, ось Y — количество последовательностей.
Количество ГЦ-пар среднее, ничем не отличающееся от основной массы других организмов.
Задание 3.4. Распределение стоп-кодонов в генах разной длины
Для анализа использовались кодирующие последовательности (CDS) генома Sphingomonas taxi, полученные из файла аннотации в формате FASTA (GCF_000764535.1_ASM76453v1_cds_from_genomic.fna).
Расчёт параметров белков:
Длина белка (а.о.) = Длина CDS (п.н.) ÷ 3
Рис. 3. Гистограмма соотношения длин белков и количества встречаемых стоп-кодонов. Ось X — диапазон длин белков, ось Y — процент стоп-кодонов.
Триплет TGA значительно выделяется в сравнении с TAA и TAG, но корреляции между длиной белка и кодоном не прослеживается.
Результаты
Результаты 3.1. Гистограмма длин белков
В результате проведённого анализа для каждого исследуемого гена была рассчитана длина соответствующего белка в аминокислотах на основе длины его нуклеотидной последовательности.
Наблюдается выраженный пик в области коротких белков: наибольшее количество белков (около 200) сконцентрировано в диапазоне длин от 0 до 50 аминокислот. По мере увеличения длины белка количество таких белков резко уменьшается.
Таким образом, результаты показывают, что в исследуемом наборе данных преобладают белки малой и средней длины, с резким доминированием коротких полипептидных цепей.
Результаты 3.2. Определение всех стоп-кодонов
- Skipped partial: 16
- Skipped bad: 4
- Skipped strange: 0
- All: {'TGA': 2562, 'TAA': 632, 'TAG': 527}
- Pseudo: {'TGA': 2, 'TAG': 1}
- Normal: {'TGA': 2560, 'TAA': 632, 'TAG': 526}
Стоп-кодон TGA является наиболее предпочитаемым стоп-кодоном в геноме S. taxi.
Результаты 3.3. Гистограмма GC-состава по CDS
GC-состав кодирующих последовательностей Sphingomonas taxi является средним и не выходит за рамки типичного для большинства организмов. Отсутствие выраженного смещения в сторону крайне низких или высоких значений GC согласуется с данными, ожидаемыми для бактериального генома.
Результаты 3.4. Распределение стоп-кодонов в генах разной длины
Проведённый анализ позволяет заключить, что предпочтение того или иного стоп-кодона в геноме Sphingomonas taxi не зависит от длины кодируемого белка. Доминирующее использование TGA является общей чертой для генов, кодирующих как короткие, так и длинные полипептиды.
Сопроводительные материалы
- I. Страница S. taxi на NCBI — https://www.ncbi.nlm.nih.gov/datasets/taxonomy/1549858/
- II. Код на Python для подсчёта стоп-кодонов — https://drive.google.com/file/d/1UFWjXIwIGRWQdResHOiAbfnqhN8rThp-/view?usp=sharing
- III. Таблица Genomic features of Sphingomonas taxi — https://docs.google.com/spreadsheets/d/1G-lfBObS1WuiKqkFVqVa5Jo1weDsznL5Bwltar8OpgU/edit?gid=514639652#gid=514639652
- IV. Таблица CDS from genome of Sphingomonas taxi — https://docs.google.com/spreadsheets/d/1oocCQFShb51X6r1bhWZXc52KIyoBZUlr7O-XuDyt9bs/edit?gid=1192405689#gid=1192405689
- V. Код на Python для нахождения соотношения стоп-кодонов и длин белков — https://drive.google.com/file/d/1KzaVyV8f3Ak5QRHzBL1kl6sjeJ64Z5RW/view?usp=sharing
- VI. Результат кода [V] и дальнейшие подсчёты — https://docs.google.com/spreadsheets/d/1DzfUkA4bOJmWDuAbsDf0HHGQ9Z8X_cPgl3emD2csMw8/edit?usp=sharing
Литература
- Eevers N. et al. Sphingomonas taxi, isolated from Cucurbita pepo, proves to be a DDE-degrading and plant growth-promoting strain // Genome announcements. — 2015. — Т. 3. — №. 3. — С. 10.1128/genomea.00489-15.