В семестре №1 проводилась с использованием геномной сборки по RefSeq идентификатору GCF_000006945.2. Для получения идентификатора INSDC я ввел ранее упомянутый идентификатор без указания версии в поиске по базе Datasets Genome и получил: GCA_000006945.2, страницу сборки в базе данных можно найти по ссылке: Страница сборки . Далее для нахождения нужного протеома я воспользовальзовался расширенным поиском UniProt. В поле “Searching in” я выбрал “Proteomes”, затем я добавил поле “Genome Assembly” где ввел свой ранее полученный идентификатор INSDС. В результате я получил протеом с идентификатором: UP000001014, со статусом: Reference proteome.
Поисковый запрос: Genome_assembly:GCA_000006945.2
Полученный ранее протеом был референсным, поэтому при расширенном поиске белков я воспользовался командой (proteome:UP000001014). Далее я прошел по кнопке “Download”, выбрал формат “Text” и сгенерировал ссылкку для API запросов. Далее я воспользовался командой: wget https://rest.uniprot.org/uniprotkb/stream?compressed=true&format=txt&query=%28%28proteome%3AUP000001014%29%29' -O UP000001014.swiss.gz и получил файл в формате gzip.
С использованием Python скрипта был произведен подсчет записей белков, содержащих альфа спирали(ключ HELIX в поле FT) и записей, содержащих трансмембранные участки(ключ TRANSMEM в поле FT).
Анализ протеома (файл UP000001014.swiss.gz) выявил значительный разрыв между количеством записей о белках, содержащих альфа-спирали (251) и белках, содержащий трансмембранные участки (972). Такое расхождение объясняется спецификой аннотирования: трансмембранные участки обычно предсказываются биоинформатическими методами, тогда как альфа-спирали фиксируются преимущественно по результатам экспериментальных исследований. Биоинформатические методы являются куда менее трудозатратными, чем эксперементальное получение вторичной структуры белка, и исходя из этого становится понятно, почему мы на наблюдаем такую разницу в записях.
Для подсчета количества ферментов был использован запрос в расширенном поиске UniProt: (proteome:UP000001014) AND (ec:*), результатом которого стали 1457 записей.
В качестве другого способа подсчета ферментов в протеоме был создан скрипт на Python, который проверяет наличие слов: “CATALYTIC ACTIVITY” и “EC=” в разделах “CC” и “DE”.
Результатом выдачи скрипта стало число в 1522 записи о ферментах в протеоме.
Исходя из полученных результатов можно сказать, что выдача скрипта, вероятно более точно отражает реальное количество ферментов в протеоме. Данные результаты можно объяснить тем, что поисковый запрос в UniProtKB учитывает только наличие поля “EC=” в разделе DE из белковых записей. В то время как скрипт также учитывает те случаи, когда белок еще не получил официального номера “EC:”, но в записях в разделе CC(комментарии) указана информация о наличии у него каталитической активности.