Практикум 8

1. Поиск протеома, соответствующего геномной сборке

В семестре №1 проводилась с использованием геномной сборки по RefSeq идентификатору GCF_000006945.2. Для получения идентификатора INSDC я ввел ранее упомянутый идентификатор без указания версии в поиске по базе Datasets Genome и получил: GCA_000006945.2, страницу сборки в базе данных можно найти по ссылке: Страница сборки . Далее для нахождения нужного протеома я воспользовальзовался расширенным поиском UniProt. В поле “Searching in” я выбрал “Proteomes”, затем я добавил поле “Genome Assembly” где ввел свой ранее полученный идентификатор INSDС. В результате я получил протеом с идентификатором: UP000001014, со статусом: Reference proteome.

Поисковый запрос: Genome_assembly:GCA_000006945.2

2. Поиск и скачивание референсного протеома

Полученный ранее протеом был референсным, поэтому при расширенном поиске белков я воспользовался командой (proteome:UP000001014). Далее я прошел по кнопке “Download”, выбрал формат “Text” и сгенерировал ссылкку для API запросов. Далее я воспользовался командой: wget https://rest.uniprot.org/uniprotkb/stream?compressed=true&format=txt&query=%28%28proteome%3AUP000001014%29%29' -O UP000001014.swiss.gz и получил файл в формате gzip.

3. Оценка числа белков, содержащих альфа-спирали

С использованием Python скрипта был произведен подсчет записей белков, содержащих альфа спирали(ключ HELIX в поле FT) и записей, содержащих трансмембранные участки(ключ TRANSMEM в поле FT).

import gzip
with gzip.open('UP000001014.swiss.gz', "rt") as file:
helix = 0
transmembrane = 0
record_hel = True
record_trans = True
for line in file:
if line.startswith("FT"):
if "HELIX" in line and record_hel:
helix += 1
record_hel = False
elif "TRANSMEM" in line and record_trans:
transmembrane += 1
record_trans = False
if line.startswith('//'):
record_trans = True
record_hel = True
print(f'Количестово альфа спиралей = {helix}, количество трансмембранных белков = {transmembrane}')

Анализ протеома (файл UP000001014.swiss.gz) выявил значительный разрыв между количеством записей о белках, содержащих альфа-спирали (251) и белках, содержащий трансмембранные участки (972). Такое расхождение объясняется спецификой аннотирования: трансмембранные участки обычно предсказываются биоинформатическими методами, тогда как альфа-спирали фиксируются преимущественно по результатам экспериментальных исследований. Биоинформатические методы являются куда менее трудозатратными, чем эксперементальное получение вторичной структуры белка, и исходя из этого становится понятно, почему мы на наблюдаем такую разницу в записях.

4. Оценка количества ферментов в протеоме

Для подсчета количества ферментов был использован запрос в расширенном поиске UniProt: (proteome:UP000001014) AND (ec:*), результатом которого стали 1457 записей.

В качестве другого способа подсчета ферментов в протеоме был создан скрипт на Python, который проверяет наличие слов: “CATALYTIC ACTIVITY” и “EC=” в разделах “CC” и “DE”.

import gzip
with gzip.open('UP000001014.swiss.gz', "rt") as file:
enzymes = 0
record_enz = True
for line in file:
if line.startswith("CC") or line.startswith("DE"):
if ("CATALYTIC ACTIVITY" in line or "EC=" in line) and record_enz:
enzymes += 1
record_enz = False
if line.startswith('//'):
record_enz = True
print(f'Количестово ферментов = {enzymes}')

Результатом выдачи скрипта стало число в 1522 записи о ферментах в протеоме.

Исходя из полученных результатов можно сказать, что выдача скрипта, вероятно более точно отражает реальное количество ферментов в протеоме. Данные результаты можно объяснить тем, что поисковый запрос в UniProtKB учитывает только наличие поля “EC=” в разделе DE из белковых записей. В то время как скрипт также учитывает те случаи, когда белок еще не получил официального номера “EC:”, но в записях в разделе CC(комментарии) указана информация о наличии у него каталитической активности.