El modelo de lenguaje del MIT aumenta la producción de proteínas en levaduras y reduce los costos de desarrollo de fármacos

Ingenieros del MIT entrenaron un modelo de lenguaje con el uso de codones de levadura para diseñar genes que aumentan la producción de proteínas, superando a las herramientas comerciales en cinco de seis proteínas. Este enfoque podría reducir los costos de desarrollo de fármacos al mejorar los rendimientos de medicamentos basados en proteínas.

Ingenieros químicos del Instituto Tecnológico de Massachusetts (MIT) han desarrollado un modelo de lenguaje que aprende los patrones de uso de codones de una levadura para diseñar genes que aumentan la producción de proteínas, lo que podría reducir el costo del desarrollo de fármacos. El modelo superó a cuatro herramientas comerciales de optimización de codones en cinco de seis proteínas probadas, incluido el anticuerpo monoclonal trastuzumab. Los hallazgos se publicaron esta semana en las Actas de la Academia Nacional de Ciencias (Proceedings of the National Academy of Sciences).

Los investigadores se centraron en Komagataella phaffii, una levadura ampliamente utilizada para producir proteínas recombinantes. Entrenaron un modelo de lenguaje grande de tipo codificador-decodificador con secuencias de aminoácidos y secuencias de ADN codificante correspondientes de aproximadamente 5,000 proteínas producidas naturalmente por la levadura, utilizando un conjunto de datos público del Centro Nacional de Información Biotecnológica (National Center for Biotechnology Information). El modelo aprende la sintaxis del uso de codones, teniendo en cuenta los codones vecinos y las relaciones de mayor alcance a lo largo de un gen.

Después del entrenamiento, el modelo diseñó secuencias optimizadas de codones para seis proteínas: hormona de crecimiento humano (hGH), factor estimulante de colonias de crecimiento humano (hGCSF), un nanocuerpo VHH llamado 3B2, una variante diseñada del dominio de unión al receptor (RBD) del SARS-CoV-2, albúmina sérica humana (HSA) y el anticuerpo monoclonal IgG1 trastuzumab. Estos diseños se compararon con secuencias producidas por cuatro herramientas comerciales: Azenta, IDT, GenScript y Thermo Fisher. Cada versión se insertó en células de K. phaffii y se midió la producción de la proteína objetivo.

En las seis proteínas, el modelo del MIT produjo el mejor título para cinco y ocupó el segundo lugar para la sexta. La optimización de codones mejoró la producción de algunas moléculas más que de otras: hGH y hGCSF mostraron una mejora de aproximadamente el 25%, mientras que HSA mostró una mejora de aproximadamente tres veces en comparación con la secuencia codificante nativa. Usando secuencias nativas, HSA alcanzó un título de 45 mg/L, mientras que la albúmina sérica bovina (BSA) y la albúmina sérica de ratón (MSA) alcanzaron 60 mg/L y 100 mg/L, respectivamente. La optimización de codones aumentó los títulos de BSA y MSA en un 25% adicional, hasta 75 mg/L y 135 mg/L.

Las herramientas comerciales variaron en consistencia. GenScript produjo el mejor título para trastuzumab, pero a menudo se situó entre el 80% y el 100% del título máximo en el conjunto. Thermo produjo los mejores títulos para tres de las seis proteínas, pero tuvo un rendimiento deficiente en otras dos, incluidos resultados más bajos para HSA y trastuzumab. IDT ocupó el último lugar en las dos métricas de rendimiento del estudio y no produjo el mejor título para ninguna proteína probada.

Related Entities

Related Articles

References

  1. How their mother's death spurred two brothers to speed up the drug discovery process through AI · financialpost.com
  2. A cheaper, more sustainable way to manufacture breakthrough HIV drug Lenacapavir · phys.org
  3. AI breakthrough could dramatically lower the cost of drug development · thebrighterside.news