import pandas as pd antigen_list = pd.read_excel("data/02a.AP0211_GLA02_SBA01_Antigen_list.xlsx") gene_names = antigen_list["Gene name"].tolist() #remove nans gene_names = [gene for gene in gene_names if pd.notna(gene)] gene_names_split = [gene.split(",") for gene in gene_names] gene_names = [gene for sublist in gene_names_split for gene in sublist] len(set(gene_names))