MIT语言模型提升酵母蛋白产量,降低药物开发成本
MIT工程师训练了一个基于酵母密码子使用的语言模型来设计基因,从而提升蛋白质产量,在六种蛋白中的五种上优于商业工具。该方法通过提高蛋白质药物的产量,有望降低药物开发成本。
麻省理工学院(MIT)的化学工程师开发出一种语言模型,该模型通过学习酵母的密码子使用模式来设计基因,从而提升蛋白质产量,有望降低药物开发成本。该模型在六种测试蛋白中的五种上表现优于四种商业密码子优化工具,其中包括单克隆抗体曲妥珠单抗(trastuzumab)。研究结果于本周发表在《美国国家科学院院刊》(Proceedings of the National Academy of Sciences)上。
研究人员聚焦于广泛用于生产重组蛋白的酵母——Komagataella phaffii。他们利用美国国家生物技术信息中心(NCBI)公开的数据集,以该酵母天然产生的约5000种蛋白质的氨基酸序列及对应的DNA编码序列为训练数据,训练了一个编码器-解码器架构的大型语言模型。该模型学习密码子使用的语法规则,并考虑相邻密码子及基因内更远距离的关联关系。
训练完成后,模型为六种蛋白质设计了密码子优化序列:人生长激素(hGH)、人粒细胞集落刺激因子(hGCSF)、名为3B2的VHH纳米抗体、SARS-CoV-2受体结合域(RBD)的工程变体、人血清白蛋白(HSA)以及IgG1单克隆抗体曲妥珠单抗。这些设计结果与四种商业工具(Azenta、IDT、GenScript和Thermo Fisher)生成的序列进行了比较。每个版本均被插入K. phaffii细胞中,并测量目标蛋白的产量。
在六种蛋白质中,MIT模型在五种上产生了最佳滴度,在第六种上排名第二。密码子优化对不同分子的产量提升程度不同:与天然编码序列相比,hGH和hGCSF的产量提升了约25%,而HSA的产量提升了约三倍。使用天然序列时,HSA的滴度达到45 mg/L,牛血清白蛋白(BSA)和小鼠血清白蛋白(MSA)分别达到60 mg/L和100 mg/L。密码子优化使BSA和MSA的滴度额外提升了25%,分别达到75 mg/L和135 mg/L。
商业工具的表现一致性各异。GenScript在曲妥珠单抗上产生了最佳滴度,但在整个测试组中通常处于最高滴度的80%至100%之间。Thermo在六种蛋白质中的三种上产生了最佳滴度,但在另外两种上表现不佳,包括HSA和曲妥珠单抗的产量较低。IDT在研究的两个性能指标上排名最低,且未在任何测试蛋白上产生最佳滴度。