Мини-обзор

Анализ особенностей генома бактерии Sphingomonas taxi

Екатеренчук А. А. | Факультет биоинженерии и биоинформатики МГУ им. М.В.Ломоносова

Аннотация

В данной работе представлен анализ особенностей генома бактерии Sphingomonas taxi с помощью базовых инструментов биоинформатики.

Введение

Sphingomonas taxi — это грамотрицательная бактерия семейства Sphingomonadaceae, выделенная в качестве эндофита из корневой ткани растений. Он является типичным представителем бактерий-ассоциантов растений и изучается в контексте биоремедиации.

Таксономическое положение организма:

  • Domain: Bacteria
  • Kingdom: Pseudomonadati
  • Phylum: Pseudomonadota (proteobacteria)
  • Class: Alphaproteobacteria (a-proteobacteria)
  • Order: Sphingomonadales
  • Family: Sphingomonadaceae (alpha-4 proteobacteria)
  • Genus: Sphingomonas
  • Species: Sphingomonas taxi

К ключевым особенностям Sphingomonas taxi, изученным в немногочисленных исследованиях, относятся способность к деградации стойкого органического загрязнителя ДДЭ (2,2-бис(п-хлорфенил)-1,1-дихлорэтилена) и комплекс ростостимулирующих свойств по отношению к растениям (активность АЦК-дезаминазы, продукция сидерофоров и ауксинов, солюбилизация фосфатов) [1]. Благодаря этим особенностям данный микроорганизм представляет значительный интерес для фундаментальной науки в области микробной деградации ксенобиотиков и микробно-растительных взаимодействий и имеет важное практическое значение для экологии и биотехнологии, а именно для разработки методов фиторемедиации загрязнённых почв.

Данная работа посвящена анализу генома Sphingomonas taxi с целью выявления уникальных особенностей организации данной бактерии.

Материалы

Геномные данные S. taxi были взяты с сайта NCBI [I]. Их дальнейший анализ проводился с использованием инструментария электронных таблиц (построение диаграмм и работа с таблицей особенностей генома), командной оболочки BASH (работа с файлами), скриптов, написанных на языке Python (анализ последовательностей генома).

Методы

Задание 3.1. Гистограмма длин белков

Для каждого гена длина соответствующего белка рассчитывалась по формуле:

Длина белка (аминокислот) = (Длина нуклеотидной последовательности (п.н.) ÷ 3) - 1 (стоп-кодон)

Обоснование: В стандартном генетическом коде каждый кодон (триплет нуклеотидов) кодирует одну аминокислоту, что позволяет точно определить длину белка по длине кодирующей последовательности.

Классификация белков по длине:

  • Короткие белки: < 100 аминокислот
  • Белки средней длины: 100-350 аминокислот
  • Длинные белки: > 350 аминокислот

Построение гистограммы

Гистограмма длин белков

Рис. 1. Гистограмма длин белков. Ось X — диапазон длин белков в аминокислотах. Ось Y — количество белков в этом диапазоне.

В основном у изучаемой бактерии белки малой и средней длины, что в целом характерно для прокариотического организма.

Задание 3.2. Определение всех стоп-кодонов

Для анализа использовались кодирующие последовательности (CDS) генома Sphingomonas taxi, полученные из аннотированного файла в формате FASTA [II]. Каждая запись в файле содержала заголовок с метаинформацией и нуклеотидную последовательность гена.

Всего было проанализировано: 3721 кодирующая последовательность, из которых:

  • 16 исключены как частичные последовательности
  • 4 исключены из-за некорректной длины
  • 0 последовательностей имели неканонические стоп-кодоны
  • 3701 последовательность прошла все фильтры

Задание 3.3. Гистограмма GC-состава по CDS

Для каждой кодирующей последовательности рассчитывался процент содержания гуанина (G) и цитозина (C) относительно общего числа нуклеотидов:

%GC = ((количество G + количество C) / общая длина последовательности) × 100%

Классификация последовательностей по GC-составу:

  • GC-бедные: %GC < 60%
  • GC-средние: %GC от 60% до 76%
  • GC-богатые: %GC > 76%
Гистограмма GC-состава

Рис. 2. Гистограмма зависимости количества последовательностей от содержания GC-пар. Ось X — процент содержания GC-пар, ось Y — количество последовательностей.

Количество ГЦ-пар среднее, ничем не отличающееся от основной массы других организмов.

Задание 3.4. Распределение стоп-кодонов в генах разной длины

Для анализа использовались кодирующие последовательности (CDS) генома Sphingomonas taxi, полученные из файла аннотации в формате FASTA (GCF_000764535.1_ASM76453v1_cds_from_genomic.fna).

Расчёт параметров белков:

Длина белка (а.о.) = Длина CDS (п.н.) ÷ 3

Распределение стоп-кодонов по длинам

Рис. 3. Гистограмма соотношения длин белков и количества встречаемых стоп-кодонов. Ось X — диапазон длин белков, ось Y — процент стоп-кодонов.

Триплет TGA значительно выделяется в сравнении с TAA и TAG, но корреляции между длиной белка и кодоном не прослеживается.

Результаты

Результаты 3.1. Гистограмма длин белков

В результате проведённого анализа для каждого исследуемого гена была рассчитана длина соответствующего белка в аминокислотах на основе длины его нуклеотидной последовательности.

Наблюдается выраженный пик в области коротких белков: наибольшее количество белков (около 200) сконцентрировано в диапазоне длин от 0 до 50 аминокислот. По мере увеличения длины белка количество таких белков резко уменьшается.

Таким образом, результаты показывают, что в исследуемом наборе данных преобладают белки малой и средней длины, с резким доминированием коротких полипептидных цепей.

Результаты 3.2. Определение всех стоп-кодонов

  • Skipped partial: 16
  • Skipped bad: 4
  • Skipped strange: 0
  • All: {'TGA': 2562, 'TAA': 632, 'TAG': 527}
  • Pseudo: {'TGA': 2, 'TAG': 1}
  • Normal: {'TGA': 2560, 'TAA': 632, 'TAG': 526}

Стоп-кодон TGA является наиболее предпочитаемым стоп-кодоном в геноме S. taxi.

Результаты 3.3. Гистограмма GC-состава по CDS

GC-состав кодирующих последовательностей Sphingomonas taxi является средним и не выходит за рамки типичного для большинства организмов. Отсутствие выраженного смещения в сторону крайне низких или высоких значений GC согласуется с данными, ожидаемыми для бактериального генома.

Результаты 3.4. Распределение стоп-кодонов в генах разной длины

Проведённый анализ позволяет заключить, что предпочтение того или иного стоп-кодона в геноме Sphingomonas taxi не зависит от длины кодируемого белка. Доминирующее использование TGA является общей чертой для генов, кодирующих как короткие, так и длинные полипептиды.

Сопроводительные материалы

Литература

  1. Eevers N. et al. Sphingomonas taxi, isolated from Cucurbita pepo, proves to be a DDE-degrading and plant growth-promoting strain // Genome announcements. — 2015. — Т. 3. — №. 3. — С. 10.1128/genomea.00489-15.