Практикум №8. Мотивы и формы их представления.

Описание мотива белка паттерном

Для выполнения заданий практикума были выбраны белки с мнемоникой "TDCD_", которая обозначает пропионаткиназу. Она катализирует превращение пропионата и АТФ в пропионилфосфат и АДФ. Также он может использовать ацетилфосфат в качестве акцептора фосфатной группы.

Всего в банке белковых последовательностей бактерий Swiss-Prot было найдено 12 белков с такой мнемоникой. Для поиска использовалась следующая команда на bash:

grep -c "TDCD_" /P/y24/term4/bacteria-sw.fasta

Далее проводилось выравнивание для первых 8 последовательностей, выбранных из списка всех найденных белков. Названия выбранных белков: TDCD_ECOLI, TDCD_SALTY, TDCD_YERE8, TDCD_ENT38, TDCD_CITK8, TDCD_SALA4, TDCD_KLEV3, TDCD_SALTD.

Файл с выравниванием

С помощью команды fuzzpro по полученному паттерну производился поиск в банке белковых последовательностей бактерий из Swiss-Prot:

Для создания паттерна был выбран участок выравнивания с 320 по 330 позицию (11 позиций). Затем по выбранному мотиву был составлен следующий паттерн:

"[GA]-[ILV]-[IV]-F-T-G-G-I-G-E-N"

fuzzpro -sequence /P/y24/term4/bacteria-sw.fasta -pattern "[GA]-[ILV]-[IV]-F-T-G-G-I-G-E-N" -outfile results_TDCD.fuzzpro

По результатам поиска были найдены все 12 белков с выбранной мнемоникой, содержащих данный мотив, представленный в виде паттерна. Соответственно, количество ложноотрицательных находок составило 0.

Поиск мотивов в белках программой MEME и поиск этих мотивов в банке

Также был произведен поиск мотивов программой MEME со следующими опциями: аминокислотные последовательности, по одному представителю мотива на последовательность, минимальная длина мотива 8, максимальная длина мотива 15 остатков, не более трёх мотивов на выравнивание:

meme TDCD_sequences.fasta -protein -minw 8 -maxw 15 -mod oops -nmotifs 3

На выходе была получена директория meme_out, содержащая файл meme_html. По результатам работы программы было найдено 3 мотива во всех выбранных белках с мнемоникой TDCD.

Для поиска найденых мотивов в файле /P/y24/term4/bacteria-sw.fasta, выдача MEME была подана на вход программы MAST:

mast ~/term4/pr8/meme_out/meme.html /P/y24/term4/bacteria-sw.fasta

На выходе была получена директория mast_out, содержащая файл mast_html. По результатам работы программы мотивы, найденные с помощью MEME были найдены во всех 364 белках с мнемоникой TDCD.

Поиск последовательности Шайна — Дальгарно в геноме

При поиске поледовательности Шайна-Дальгарно (AGGAGG) в геноме бактерии Streptomyces rutgersensis. Поиск производился программой fuzznuc по прямой и комплиментарной цепям:

fuzznuc -sequence GCF_000444875.1_ASM44487v1_genomic.fna -pattern "A-G-G-A-G-G" -complement Y -outfile ~/term4/pr8/fuzznuc_out.txt

Всего было обнаружено 8135 находок на прямой цепи и 8955 на обратной (всего 17090).

Последовательность исследуемого генома имеет длину в 8272925 нуклеотидов и следующее содержание нуклеотидов: G: 36,3%; C: 36,3%; T: 13,7%; A: 13,7%.

Таким образом, число случайных мотивов AGGAGG с учетом комплиментарной цепи будет примерно равно (0,137*0,363^2)^2*8272925*2=5391.

Для оценки достоверности найденного числа находок был использован биномиальный тест. Расчётное p-значение получилось меньше 2,2·10⁻¹⁶, что на уровне значимости α = 0,001 говорит о статистически значимом различии между случайным и реальным числом находок. Наблюдаемое число мотивов превышает ожидаемое примерно в 3,17 раза, что свидетельствует о функциональной значимости мотива AGGAGG (последовательность Шайна–Дальгарно) в исследуемом геноме.

Посмотрев на координаты 20 случайных находок и сравнив их с кординатами предполаемых мотивов AGGAGG (10-15 нуклеотидов от CDS) оказалось, что ни одна из них не находится на необходимом расстоянии от старт кодона, чтобы считаться последовательностью Шайна-Дальгарно. Это может говорить о том, что у исследуемой бактерии последовательность Шайна-Дальгарно не является столь консервативной.