Avanzar la predicción de la estructura de interacción de proteínas -proteína con IA

El Dr. Alan Nafiiev evalúa las plantillas y sin plantillas para la predicción de PPI, enfatizando cómo IA puede mejorar la precisión estructural.

Ilustración 3D de complejos de proteínas que muestran detalles de la superficie molecular en rojo, naranja y amarillo, lo que representa las interacciones de proteínas, la proteína relevante para el descubrimiento de fármacos.


Presentación

Las interacciones proteína -proteína (IPP) son contactos específicos formados cuando dos proteínas se unen. Comprender sus estructuras de tres dimensiones es esencial para diseñar compuestos que puedan modular las IPP, que es la estrategia más ventajosa para tratar muchas enfermedades.1 Sin embargo, la determinación experimental de las estructuras de IPP es lenta, costosa y a menudo técnicamente difícil.

Actualmente, el enfoque computacional primario para la predicción de la estructura PPI ha sido la proteína de descarga de proteínas, donde las estructuras de proteínas conocidas se colocan para identificar una interfaz plausible. Este método permanece esencialmente limitado porque trata las proteínas como cuerpos rígidos y no tiene en cuenta los efectos de los solventes, los reordenamientos de la cadena lateral, la flexibilidad de la columna vertebral y otros factores biofísicos.2

Ahora la inteligencia artificial (AI) está dispuesta a romper estos límites.

Predicción de la estructura PPI basada en la plantilla

Los métodos de predicción de PPI cumplen con los complejos tomando dos secuencias objetivas, encontrando un complejo homólogo en una base de datos estructural y «uva» la columna vertebral y la interfaz conocida para la nueva pareja. Cuando hay una plantilla cercana, esto puede causar interfaces significativamente precisas en unos minutos. Los modelos generativos recientes, como Alfafold-Multimer o Rosettefold, también se basan en los mismos complejos resueltos como parte de sus datos de entrenamiento, pero integran aún más las alineaciones de secuencias múltiples profundas y las señales coevolutivas.3

Sin embargo, la biblioteca del personal sigue siendo escasa. Biogrid sería probado por más de 1,4 millones de IPP humanas,4 Sin embargo, solo una fracción minúscula, solo 4,594 complejos, tienen estructuras de alta resolución en PDBBind-plus: una base de datos diseñada para ofrecer una colección completa de datos de afinidad sindical experimental para complejos biomoleculares.5 Esto significa que las plantillas cubren menos del 1 por ciento de la interacección humana estimada, incluso agregando estructuras únicas de otras fuentes. Además, los complejos que conocemos están muy sesgados hacia los conjuntos estables, solubles y globulares, mientras que la mayoría de las interacciones celulares son transitorias, involucran regiones desordenadas intrínsecamente u ocurren en superficies de membrana. Como los métodos basados ​​en la plantilla dependen directamente de los datos estructurales disponibles, su precisión colapsa fuera de este subconjunto estrecho.

BT_VISUAL_1

Figura 1. La proporción de complejos PPI resueltos entre los IPP conocidos. Crédito: receptor.ai

Predicción de PPI sin plantillas

Con un ejemplo de tecnología de receptores. La predicción de PPI sin plantillas requiere un ataque fundamentalmente diferente: en lugar de buscar un andamio coincidente, primero escanea cada superficie de proteína para ubicar los «puntos calientes», las pechuiciones de las propiedades de las propiedades de la cadena lateral (tamaño, hidrófobo, potencial de carga y exposición al solvente) favorecen la unión.6

Bt_visual_2.jpg

Figura 2. Flujo de trabajo de Deeptag. Las interfaces candidatas se dividen en tres subterráneas y son calificadas por diferentes capas de IA con diferentes datos de entrenamiento. Luego se determina la puntuación de consenso. Crédito: receptor.ai

Una vez identificados puntos calientes de cada pareja, se hace un punto caliente para definir un conjunto limitado de interfaces candidatas. Para cada candidato, se construyen matrices de contacto que describen qué residuos de proteína son a la distancia de enlace de la proteína B.

Aquí, el aprendizaje automático se destaca a través de modelos entrenados en contactos de desechos para desperdiciar en dominios plegados para obtener cada matriz de interacción de proteínas para su energía sindical planificada. Como las estructuras monoméricas son más investigadas que las estructuras de complejos de proteínas, este método también funciona para complejos lejos de los conocidos.

Con la mejor interfaz puntuada definida, el resto del complejo se construye a su alrededor y el conjunto completo está probando la estabilidad a través de simulaciones de dinámica molecular. Debido a que la interfaz PPI en sí es el objetivo principal del diseño de medicamentos, garantizando su precisión, incluso si otras regiones se modelan con menos precisión, es suficiente para los esfuerzos de descubrimiento de fármacos aguas abajo.

Resultados de referencia

Bt_visual_3.jpg

Figura 3. Comparación de métodos de retención y IA en el punto de referencia Pinder-AF2 (30 pares no vinculados). Las barras muestran el porcentaje de complejos que logran una precisión Dockq aceptable, promedio o alta para los 1 superiores, Top-5 y todas las predicciones de cada método. Crédito: receptor.ai

Para comparar objetivamente los flujos de trabajo basados ​​en plantillas, alborentes y sin plantillas, los probamos en un punto de referencia estandarizado para los objetivos desafiantes de Pinder-AF2. Su conjunto de datos comprende 30 complejos proteína-proteína que solo se proporcionan como estructuras de monómeros no vinculados, lo que refleja escenarios en el mundo real donde no hay complejo previo disponible. Cada método se encargó de generar complejos que posteriormente fueron evaluados por el Dockq métrico Capri, que marca la similitud estructural con el complejo nativo en una escala donde 0.23-0.49 es aceptable, 0.49-0.80 es promedio y superior a 0.80 es alto.7 Los resultados se informan para la predicción del Top-1, el mejor entre los 5 mejores y todas las predicciones.

La predicción basada en la plantilla, ejemplificada por Alfafold-Multimer, funciona peor que el clásico acceso al cuerpo rígido a HDOCK. Las métricas Alfafold-Multimer apenas cambian cuando se expanden de Top-1 a todas las predicciones, lo que significa que el modelo simplemente no proporciona suficientes interfaces de alta calidad.

En contraste, la predicción de plantilla libre ya excede la proteína-proteína, incluso en los resultados de Top-1. Además, los gráficos muestran que el departamento genera una parte aún mayor de los complejos de alta calidad (casi la mitad de todos los candidatos alcanzan la precisión «alta»), pero no todos se clasificaron en el modelo más alto. Con un trabajo continuo para mejorar la puntuación, el rendimiento del modelo en el descubrimiento real de fármacos será realmente inigualable.

Conclusión

En conclusión, la predicción de PPI sin plantillas son los límites de la escasez de plantillas que se centran en los puntos calientes en la superficie de la proteína. Deptag ya excede la proteína -proteína en precisión y, con mejoras continuas de puntuación, promete un apoyo realmente inigualable para la orientación de PPI en el descubrimiento de drogas. La IA es una herramienta poderosa, pero no una solución única, debe aplicarse de manera considerable y en el contexto correcto.

Conoce al autor

Alan nafiiev_photo.jpg

El Dr. Alan Nafiiev es el CEO y fundador de Receper.ai, donde desarrolla infraestructura promovida por AI para el descubrimiento de drogas. Con un doctorado en informática, su experiencia abarca moléculas pequeñas, péptidos, proteínas proteínas y terapéutica de proximidad inducida. Su trabajo actual y escritura se centran en métodos híbridos físicos AI-AI, excelentes estrategias de I + D en el lenguaje escalable y el modelo de automatización para el diseño de medicina basada en la evidencia.

Referencias

  1. Singh A, Nguyen B, Ng HL. Editor: Predicción de interacciones proteína-proteína (IPP): el siguiente borde. Bordes en biosciencia molecular. 2024; 11. Dos: 10.3389/fmolb.2024.1479705
  2. Lo más destacado, el portero y Xia B, et al. Rendimiento y límites en el trabajo rígido de proteína-proteína-proteína. Estructura. 2020; 28 (9): 1071-1081.e3. Dos: 10.1016/j.str.2020.06.006
  3. Evans R, O’Neill M, Pritamen, et al. Predicción del complejo proteico con Alfafold-Multimer. Biorxiv. 2021. Doi: 10.1101/2021.10.04.463034
  4. Biográfico. Estadísticas. El depósito biológico general para conjuntos de datos de interacción. Consultado el 15 de agosto de 2025. Https://wiki.thebiogrid.org/doku.php/statistics
  5. Base de datos PDBBind-Plus. Consultado el 15 de agosto de 2025. Https://www.pdbbind-plus.org.cn/
  6. Chen YC, Sargsyan K, Wright JD, et al. PPI-Topótido para detectar puntos de proteína proteína caliente caliente de la estructura de proteínas libres. elegante. 2024; 13: RP96643. Doi: 10.7554/elife.96643.3
  7. Basu S, Wallner B. Encuentra modelos de proteínas -Proteína correcta a través de ProQdock. Bioinformática. 2016; 32 (12): I262-I270. Doi: 10.1093/bioinformática/btw257

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *