• Второй семестр
• Семестры
• Главная страница

Практикум 12. Алгоритмы и программы множественного выравнивания

1. Программа сравнения выравниваний

Для сравнения выравниваний я использовала код Елены Гончаровой (compare_aln.py).

2. Сравнение выравниваний тремя программами

Я сравнивала MSA одних и тех же семи последовательностей ACNA (из практикума 9), построенные программами MUSCLE, MAFFT и Clustal Omega (в отчёте — Clustal). За референс A приняла MUSCLE; пары сравнения: A с B (MUSCLE–MAFFT) и A с C (MUSCLE–Clustal).

Файлы выравниваний: pr12_muscle.fa, pr12_mafft.fa, pr12_clustal.fa.

Проект Jalview со сравниваемыми выравниваниями: pr12.jvp.

MUSCLE vs MAFFT

Таблица 1. Сводка сравнения MUSCLE и MAFFT

ПараметрMUSCLEMAFFT
Длина выравнивания963962
Совпадающих колонок862
% от длины89.5%89.6%
Число блоков (длина ≥ 2)10
Одиночных совпадений вне блоков1 — (807,806)

Таблица 2. Блоки одинаково выровненных колонок (MUSCLE = MAFFT)

(s1,f1) MUSCLE(s2,f2) MAFFTДлина
(469,661)(468,660)193
(212,359)(214,361)148
(809,925)(808,924)117
(86,200)(88,202)115
(723,805)(722,804)83
(18,81)(20,83)64
(665,720)(664,719)56
(366,404)(369,407)39
(930,963)(929,962)34
(423,434)(422,433)12

Крупные несовпадающие участки в MUSCLE (между блоками): 1–17, 201–211, 405–422, 435–468 и др. — в основном около N-конца и в середине, где у ACNA_MYCTU протяжённая вставка.

MUSCLE vs Clustal

Таблица 3. Сводка сравнения MUSCLE и Clustal

ПараметрMUSCLEClustal
Длина выравнивания963958
Совпадающих колонок859
% от длины89.2%89.7%
Число блоков (длина ≥ 2)11
Одиночных совпадений вне блоков0

Таблица 4. Блоки одинаково выровненных колонок (MUSCLE = Clustal)

(s1,f1) MUSCLE(s2,f2) ClustalДлина
(465,663)(460,658)199
(208,363)(207,362)156
(86,200)(85,199)115
(809,901)(804,896)93
(723,804)(718,799)82
(667,720)(662,715)54
(43,81)(42,80)39
(366,404)(365,403)39
(930,963)(925,958)34
(1,31)(1,31)31
(909,925)(904,920)17

Самый длинный разрыв совпадений в MUSCLE — участок 405–464 (длина 60), снова в зоне вариабельной середины.

Обсуждение

Оба сравнения дают высокую долю одинаково выровненных колонок (~89%). По проценту совпадений от длины MUSCLE ближе к MAFFT (89.5%), чем к Clustal (89.2%). У MUSCLE–MAFFT блоки крупные и идут почти непрерывно по длине белка; у MUSCLE–Clustal блоков чуть больше (11), но суммарная длина совпадающих колонок чуть меньше, а разрыв в середине длиннее. Дополнительно MAFFT vs Clustal даёт уже 87.9% совпадений — то есть MAFFT и Clustal расходятся между собой сильнее, чем каждый из них с MUSCLE.

Вывод: на этом наборе последовательностей B (MAFFT) больше похоже на A (MUSCLE), чем C (Clustal). Различия сосредоточены у концов и в «дыре» ~колонки 400–470 (вставка у ACNA_MYCTU), где программы по-разному размещают гэпы.

3. Структурное и последовательностное выравнивание WW-доменов

Для пункта 3 я взяла три структуры WW-доменов (семейство PF00397) из разных белков человека: 1I6C (PIN1), 1K9Q (YAP1) и 2KPZ (NEDD4), цепь A. PDB-файлы: 1I6C.pdb, 1K9Q.pdb, 2KPZ.pdb; последовательности цепей — в pr12_proteins.fasta.

Последовательностное MSA — MUSCLE (pr12_proteins_muscle.fa). Структурное совмещение и выравнивание я сделала в RCSB PDB Pairwise Structure Alignment методом TM-align, референс — 1I6C:A (открыть сессию с результатами). Инструмент даёт попарные структурные выравнивания к референсу; FASTA пар: pr12_rcsb_1I6C_1K9Q.fa, pr12_rcsb_1I6C_2KPZ.fa.

Таблица 5. Оценки TM-align на RCSB (референс 1I6C:A)

СтруктураRMSD, ÅTM-score IdentityВыровнено остатков
1K9Q:A2.150.4435%29
2KPZ:A2.100.5138%30

TM-score ~0.4–0.5 при identity ~35–38%: ядро складки общее (три антипараллельных β-тяжа WW), но последовательности заметно разошлись. У 2KPZ моделируется 34 из 49 остатков цепи (гибкие концы), поэтому покрытие по моделированным остаткам выше (88%), чем у 1K9Q (73%).

Наложение структур 1I6C, 1K9Q и 2KPZ

Рисунок. Совмещение WW-доменов 1I6C, 1K9Q и 2KPZ (зелёный / оранжевый / синий). Ядро складки совпадает; расхождения в основном в петлях и на концах.

Сравнение MUSCLE с RCSB (попарно)

Из MSA MUSCLE я извлекла те же пары, что даёт RCSB (для 2KPZ — только упорядоченное ядро из 34 аа), и сравнила через compare_aln.py: pr12_muscle_1I6C_1K9Q.fa / pr12_rcsb_1I6C_1K9Q.fa, pr12_muscle_1I6C_2KPZ.fa / pr12_rcsb_1I6C_2KPZ.fa. Списки пар колонок: compare_muscle_rcsb_1I6C_1K9Q.tsv, compare_muscle_rcsb_1I6C_2KPZ.tsv.

Таблица 6. Сводка: MUSCLE vs RCSB

ПараДлина MUSCLEДлина RCSB Совп. колонок% от MUSCLEБлоков ≥ 2
1I6C–1K9Q46503984.8%4
1I6C–2KPZ39413589.7%2

Таблица 7. Блоки одинаково выровненных колонок

Пара(s1,f1) MUSCLE(s2,f2) RCSBДлина
1I6C–1K9Q(23,40)(27,44)18
1I6C–1K9Q(10,19)(12,21)10
1I6C–1K9Q(1,7)(1,7)7
1I6C–1K9Q(42,45)(46,49)4
1I6C–2KPZ(3,34)(5,36)32
1I6C–2KPZ(38,39)(40,41)2

Обсуждение

Наложение на RCSB показывает, что три WW-домена действительно делят одну складку (низкий RMSD ~2.1 Å при умеренном TM-score). По колонкам MUSCLE совпадает со структурным выравниванием на ~85–90%: лучше для пары PIN1–NEDD4 (один крупный блок из 32 колонок), чуть слабее для PIN1–YAP (разрывы у N-конца YAP и в петле). Расхождения — в основном гэпы на концах и в коротких петлях, где последовательность «угадывает» иначе, чем Cα-суперпозиция.

Вывод: для этих WW-структур последовательностное и структурное выравнивания в ядре домена согласованы, но не тождественны; картинка совмещения это подтверждает визуально.

4. Краткое описание программы MAFFT

MAFFT является, пожалуй, самым интересным с точки зрения решения задачи MSA среди всех программ, т.к. подходит к решению со стороны физико-химических свойств и мат. анализа, а не исключительно дискретной математики и теории алгоритмов. Концептуально алгоритм превращает последовательность в сигнал, путём сопоставления каждой аминокислоте её характеристики (размер боковой цепи + полярность). С сигналом уже можно работать, как с волной, применяя к нему мат. аналитический аппарат, в том числе быстрые преобразования Фурье (FFT) — это первый этап. Собственно алгоритм:

  1. Все последовательности переводятся в числовые профили. С помощью FFT вычисляется кросс-корреляция всех пар последовательностей. Найденные пики корреляции фиксируются как якоря. Короткие невыровненные участки между якорями доделываются обычным локальным динамическим программированием (Нидлман–Вунш и т.п.).
  2. На основе результатов попарного выравнивания строится матрица дистанций (насколько далеки последовательности друг от друга). Затем с помощью методов кластеризации (обычно UPGMA или Neighbor-Joining) строится направляющее дерево (guide tree), которое определяет порядок объединения.
  3. Последовательности выравниваются друг с другом вдоль ветвей дерева, начиная с самых похожих (листьев дерева) и двигаясь к корню. Когда нужно выровнять два уже созданных профиля, MAFFT снова использует FFT для быстрого поиска совпадений между их усреднёнными числовыми представлениями.
  4. Ошибки MAFFT исправляет так: случайно делит полученное итоговое выравнивание на две группы (разрезает ветвь дерева) и перевыравнивает эти группы между собой. Если целевая функция (WSP-score — взвешенная сумма пар) улучшается, новое выравнивание принимается. Процесс повторяется до сходимости.

Говоря «применяется FFT», я подразумеваю: перекодировав аминокислоты, мы получаем по 2 числовых ряда (для объёма и полярности) на последовательность. Теперь нас интересует, а насколько будут похожи последовательности, если мы будем сдвигать одну относительно другой — для этого мы считаем сумму произведения членов рядов со сдвигом — кросс-корреляция. Это сложно вычислительно, так что применяем FFT и вычисляем спектры обоих сигналов, и уже перемножаем их, проводим обратное FFT и имеем кросс-корреляцию, для значений которой мы ищем пики — якоря, а Н.–В. используем для пробелов.

Источники: A Modified Multiple Alignment Fast Fourier Transform with Higher Efficiency (https://pubmed.ncbi.nlm.nih.gov/26890922/), полный текст был изучен на Sci-hub.