Задания для устной сдачи
В ведомости для каждого студента указан набор данных, с которым нужно работать.
Обязательно возьмите именно свой набор данных!!!
Нижепредложенные задания нужно выполнять средствами только базового R.
При сдаче необходимо запустить написанный вами код и устно пояснить логику решения.
Не забывайте, что решения должны быть продемонстрированы так, чтобы можно было убедиться в корректности и правильности вашего кода без его дописывания.
Каждое утверждение должно быть вынесено согласно результату работы вашего кода.
Можно писать комментарии, но они должны нести вспомогательный, справочный характер. Длинный связный текст, особенно сгенерированный внешними силами, нельзя приводить в качестве комментариев к коду.
Задание 1
Создайте свой уникальный набор данных
Сначала установите индивидуальный seed: разделите год вашего рождения на произведение дня и месяца вашего рождения, округлите до целого.
Прочитайте закрепленный за вами набор данных полностью.
Случайным образом отберите:
vaccine_data_2026.txt - 4000 уникальных пациентов
crispr_data_2026.txt - 4000 уникальных таргетных генов
microbiome_data_2026.txt - 4000 уникальных пациентов
Задание 2
Охарактеризуйте получившуюся выборку по ряду параметров
Для демонстрации подберите корректный способ визуализации. Не забудьте, что у рисунка должен быть заголовок, подписи осей, все текстовые элементы должны быть видны, а легенда тоже должна быть, если это необходимо, но не закрывать важные части графика.
vaccine_data_2026.txt - опишите вошедших в вашу выборку участников с точки зрения пола, этнической принадлежности и возраста.
crispr_data_2026.txt - опишите, как выбранные вами гены распределены по биологическим путям, по биотипам согласно геномной аннотации, а также как распределен уровень экспрессии этих генов (Expression_Value).
microbiome_data_2026.txt - опишите вошедших в вашу выборку пациентов с точки зрения пола, группы лечения и возраста.
Сначала изучите каждый признак отдельно, а затем в качестве необязательного дополнительного(*) задания попробуйте совместить категориальные признаки. Например, для vaccine_data_2026.txt покажите, сколько мужчин и женщин в каждой этнической группе.
Для всех вариантов оцените количество пропущенных значений в вашей выборке, тут тоже нужна визуализация.
Задание 3
Визуально исследуем некоторые зависимости
vaccine_data_2026.txt
Есть ли разница в изменении титра нейтрализующих антител между измерениями в точках Month3 и Week2 для каждого пациента в зависимости от факта перенесенной ранее инфекции?
crispr_data_2026.txt
Есть ли разница в изменении доли клеток в S-фазе клеточного цикла между 21ым и нулевым днями для каждого гена в зависимости от функциональной категории гена в контексте скрининга?
microbiome_data_2026.txt
Есть ли разница в изменении доли бактерий группы Bacteroides в микробиоте между измерениями в точках Week12 и Baseline для каждого пациента в зависимости от группы лечения?
Решите сами, как именно вы будете работать с пропущенными значениями.
Для того, чтобы доказать наличие или отсутствие какой-либо разницы или зависимости, необходимо как минимум сформулировать гипотезу и реализовать соответствующий статистический тест. В нашем случае ограничимся только визуальным анализом.
Решением задачи должны быть рисунок и ваш короткий комментарий к нему.
Подумайте, как технически реализовать решение третьей задачи. Путей может быть много, но старайтесь использовать только те функции, которые есть в предложенных материалах. В противном случае разберитесь, как именно работает полученный вами код. Напоминаю, что нужно использовать только функции базового R.
Вы всегда можете создавать необходимые подвыборки с нужной вам фильтрацией, класть их в переменные, а затем «склеивать» их по столбцам (cbind) или строкам (rbind). Обратите внимание, что возможно, в некоторых случаях вам потребуется проверять уникальность отобранных значений.

2026
2024
2023
2022
2021
2020
2019
2018