| Protein name | ID1 | ID2 | Score | % Identity | % Similarity | Gaps | Indels |
| Periplasmic pH-dependent serine endoprotease DegQ | DEGQ_ECOLI | DEGQ_BACSU | 16 | 1,8 | 4,6 | 409 | 2 |
| Nitrige regulatory protein GlnK | GLNK_ECOLI | GLNK_BACSU | 20 | 3 | 6,2 | 406 | 6 |
| Replicative helicase loader DnaC | DNAC_ECOLI | DNAC_BACSU | 47 | 11,8 | 19,4 | 301 | 17 |
| Protein name | ID1 | ID2 | Score | % Identity | % Similarity | Gaps | Indels | Coverage 1 | Coverage 2 |
| Periplasmic pH-dependent serine endoprotease DegQ | DEGQ_ECOLI | DEGQ_BACSU | 22 | 71,4 | 71,4 | 0 | 0 | 1,54% | 16,28% |
| Nitrige regulatory protein GlnK | GLNK_ECOLI | GLNK_BACSU | 29 | 23,4 | 45,3 | 15 | 5 | 50,00% | 13,90% |
| Replicative helicase loader DnaC | DNAC_ECOLI | DNAC_BACSU | 62,5 | 21,8 | 35,4 | 69 | 12 | 80,82% | 48,24% |
Значение идентичности и сходства в глобальном выравнивании крайне низкие, а количество гэпов просто огромное, относительно длины белков. Это означает. что выравнивание, скорее всего, не выявляет реального родства - а лишь растягивает последовательности с помощью множества разрываов, чтобы хоть как-то их сопоставить. эти цифры практичсеки не отличимы от случайного совпадения.
Локальное выравнивание в данном случае будет гораздо более информативным, чем глобальное. в DEGQ высокий процент идентичности, однако, очень низкое покрытие (всего ~16% и ~1,5%). Вероятнее всего это означает, что был найтен короткий, но высококонсервативный участок. Этот участок действительно является гомологичным, однако неко не отражает гомологию белков в целом. Аналогичная ситуация с GLNK, там цифры идентичности ипокрытия еще ниже. Вероятно, у двух этих бклков присутствуют гомологичные высококонсервативные домены, однако полноценной гомологии нет. У DNAC дело обстоит лучше. из трех выбранных образцов у него наибольшие покрытие при идентичности 21,8%. Это уже может говорить о реальной гомологичности большей части последовательности.
По этим наблюденям видно, что глобальное выравнивае часто является менее информативно для выявления постедовательностей, имеющих короткие гомологичные участки, вероятнее всего, унаследованные от дальнего предка, а то и вовсе повившихся конвергентно.
| Aligment | ID1 | ID2 | Score | % Identity | % Similarity | Gaps | Indels | Coverage 1 | Coverage 2 |
| Global | FKBA_ECOLI | O16G2_BACSU | 23 | 5,5 | 8,2 | 589 | 15 | - | - |
| Local | FKBA_ECOLI | O16G2_BACSU | 55 | 24,5 | 36,7 | 44 | 8 | 44,44% | 23,17% |
Интересным получился анализ негомологичных белков. Их локальное выравнивание имеет более высоие проценты идентичности и сходства чем у 'гомологичных' белков выше. Это говорит о том, что локальное выравнивание может находить случайные короткие совпадения даже между неродственными белками.
Для множественного выравнивания была выбрана мнемоника DNAC. С помощью расширенного поиска в UniProtKB были найдены другие записи с такой жк мнемоникой в Swiss-Prot.
По запросу нашлось 45 результатов. Для выравнивания использовались (DNAC_=*) *ECO57, *BUCAP, *BUCBP, *BACSU, *ECOL6, *BUCAI, *SHIFL. Затем в Jalview с помощью программы Mafft было сделаноо множественное выравнивание
У получннного выравнивания не очень высокий, но в нем присутствуют и консервативнфе участки (84-93, 124-139, 224-244 и так далее). Мне кажется, что последовательность BACSU выровнялась хуже остальных: она практически нигде не совпдает консервативными участками. Скорее всего, она не является гомологом для остальных белков. Это пример того, как множественное выравнивание помогает отбраковать ложных членов семейства. Остальные последовательности на мой взгляд гомологичны.
Действительно, по данным этой статьи E.DnaC и B.Dnac являются аналогами, а не ортологами. У них есть далекий общий предок, но E.Dnac является загрузчиком хеликазы, а B.Dnac - самой хеликазой. Загрузчиком хеликазы у BACSU (то есть гомологом E.Dnac) является B.DnaI