Files
intro_data_science/xmap_biomarkers/count_genes.py
T

9 lines
373 B
Python
Executable File

import pandas as pd
antigen_list = pd.read_excel("data/02a.AP0211_GLA02_SBA01_Antigen_list.xlsx")
gene_names = antigen_list["Gene name"].tolist()
#remove nans
gene_names = [gene for gene in gene_names if pd.notna(gene)]
gene_names_split = [gene.split(",") for gene in gene_names]
gene_names = [gene for sublist in gene_names_split for gene in sublist]
len(set(gene_names))