Для выполнения заданий практикума были выбраны белки с мнемоникой "TDCD_", которая обозначает пропионаткиназу. Она катализирует превращение пропионата и АТФ в пропионилфосфат и АДФ. Также он может использовать ацетилфосфат в качестве акцептора фосфатной группы.
Всего в банке белковых последовательностей бактерий Swiss-Prot было найдено 12 белков с такой мнемоникой. Для поиска использовалась следующая команда на bash:
grep -c "TDCD_" /P/y24/term4/bacteria-sw.fasta
Далее проводилось выравнивание для первых 8 последовательностей, выбранных из списка всех найденных белков. Названия выбранных белков: TDCD_ECOLI, TDCD_SALTY, TDCD_YERE8, TDCD_ENT38, TDCD_CITK8, TDCD_SALA4, TDCD_KLEV3, TDCD_SALTD.
По результатам поиска были найдены все 12 белков с выбранной мнемоникой, содержащих данный мотив, представленный в виде паттерна. Соответственно, количество ложноотрицательных находок составило 0.
Поиск мотивов в белках программой MEME и поиск этих мотивов в банке
Также был произведен поиск мотивов программой MEME со следующими опциями: аминокислотные последовательности, по одному представителю мотива на последовательность, минимальная длина мотива 8, максимальная длина мотива 15 остатков, не более трёх мотивов на выравнивание:
На выходе была получена директория meme_out, содержащая файл meme_html. По результатам работы программы было найдено 3 мотива во всех выбранных белках с мнемоникой TDCD.
Для поиска найденых мотивов в файле /P/y24/term4/bacteria-sw.fasta, выдача MEME была подана на вход программы MAST:
На выходе была получена директория mast_out, содержащая файл mast_html. По результатам работы программы мотивы, найденные с помощью MEME были найдены во всех 364 белках с мнемоникой TDCD.
Поиск последовательности Шайна — Дальгарно в геноме
При поиске поледовательности Шайна-Дальгарно (AGGAGG) в геноме бактерии Streptomyces rutgersensis. Поиск производился программой fuzznuc по прямой и комплиментарной цепям:
fuzznuc -sequence GCF_000444875.1_ASM44487v1_genomic.fna -pattern "A-G-G-A-G-G" -complement Y -outfile ~/term4/pr8/fuzznuc_out.txt
Всего было обнаружено 8135 находок на прямой цепи и 8955 на обратной (всего 17090).
Последовательность исследуемого генома имеет длину в 8272925 нуклеотидов и следующее содержание нуклеотидов: G: 36,3%; C: 36,3%; T: 13,7%; A: 13,7%.
Таким образом, число случайных мотивов AGGAGG с учетом комплиментарной цепи будет примерно равно (0,137*0,363^2)^2*8272925*2=5391.
Для оценки достоверности найденного числа находок был использован биномиальный тест. Расчётное p-значение получилось меньше 2,2·10⁻¹⁶, что на уровне значимости α = 0,001 говорит о статистически значимом различии между случайным и реальным числом находок. Наблюдаемое число мотивов превышает ожидаемое примерно в 3,17 раза, что свидетельствует о функциональной значимости мотива AGGAGG (последовательность Шайна–Дальгарно) в исследуемом геноме.
Посмотрев на координаты 20 случайных находок и сравнив их с кординатами предполаемых мотивов AGGAGG (10-15 нуклеотидов от CDS) оказалось, что ни одна из них не находится на необходимом расстоянии от старт кодона, чтобы считаться последовательностью Шайна-Дальгарно. Это может говорить о том, что у исследуемой бактерии последовательность Шайна-Дальгарно не является столь консервативной.