Coinfección de VIH-1/VHB Predicción precisa de objetivos múltiples utilizando un modelo de predicción de conjunto basado en redes neuronales gráficas Ⅲ
Aug 02, 2023
3. Discusión
Aproximadamente 2 mil millones de personas en todo el mundo han sido infectadas con el virus de la hepatitis B (VHB), de las cuales más de 350 millones padeceninfección crónica,y entre 500,000y 700,000 personas mueren a causa de la infección por VHB cada año. Además, a partir de 2019, aproximadamente 38 millones de personas en todo el mundo vivían con el VIH, incluidos 1,8 millones de niños menores de 15 años. En 2019, casi 690,000 personas en todo el mundo murieron a causa de enfermedades relacionadas con el SIDA. Debido a las rutas de transmisión similares del VIH y el VHB, los dos virus transmitidos por la sangre, la alta incidencia de coinfección conduce a importantes problemas de salud a nivel mundial. A diferencia de las infecciones únicas de estos virus, las coinfecciones pueden provocar una variedad de enfermedades relacionadas con el hígado, disfunción de órganos no hepáticos y la muerte. El tratamiento de los pacientes coinfectados es complicado debido a los efectos secundarios de los medicamentos antivirales, lo que genera resistencia a los medicamentos, toxicidad hepática y falta de una respuesta eficaz. Además, las personas coinfectadas deben ser tratadas con múltiples medicamentos al mismo tiempo, lo que resulta en ladiagnóstico complejo, tratamiento, ycontrol de VIH y VHBcoinfecciones Por lo tanto, la investigación y el desarrollo denuevas drogasconobjetivos múltiples es un problema urgente.

HAGA CLIC AQUÍ PARA CONOCER LA CITANCHE PARA PREVENIR INFECCIONES
Sin embargo, la metodología tradicional de descubrimiento de fármacos que utiliza experimentos para seleccionar fármacos candidatos es costosa y requiere mucho tiempo. Con el desarrollo de algoritmos de aprendizaje automático y aprendizaje profundo, se han realizado rápidas innovaciones en la detección virtual. Uno de los procedimientos más importantes para la aplicación de modelos de aprendizaje automático para la detección de compuestos a gran escala es la extracción de características moleculares. Las redes neuronales gráficas (GNN) abrieron avances para el aprendizaje de conexiones entre átomos debido a su capacidad de representación para las estructuras gráficas espaciales de las moléculas.
En este estudio, comparamos tres tipos de redes neuronales gráficas por su capacidad para extraer características moleculares reemplazando las capas de salida de estas redes neuronales con un algoritmo de aprendizaje supervisado óptimo, GBDT. Se seleccionó el modelo de conjunto DMPNN más GBDT para la pesca multiobjetivo de VIH-1/VHB en función de la combinación de 12 clasificadores binarios. El estudio de prueba de principio demostró que la integración de DMPNN y GBDT puede mejorar de manera eficiente el rendimiento de la predicción con respecto a los objetivos de VIH-1 y VHB en comparación con el aprendizaje automático único o los algoritmos de red neuronal única. Además, se predijo que 22 medicamentos aprobados contra el VIH-1 y 8 medicamentos aprobados contra el VHB tenían objetivos múltiples potenciales, con 8 de ellos validados por referencias. Además, para verificar nuestras predicciones objetivo de los diez nuevos compuestos, se adoptaron simulaciones de acoplamiento molecular para proporcionar una inspección detallada del modo de unión de cada compuesto, donde se predijo que seis compuestos tendrían relaciones gemelas con los objetivos del VIH y el VHB, que han sido verificados. por el algoritmo de acoplamiento molecular. Por lo tanto, los resultados mostraron que es posible diseñar inhibidores específicos que se dirijan al VIH-1 y al VHB simultáneamente. Además, nuestro modelo de conjunto tiene la posibilidad de detectar de forma eficaz los co-inhibidores multidiana de la coinfección por VIH/VHB y tiene aplicaciones potenciales para el cribado virtual de fármacos multidiana para el tratamiento de otras enfermedades complejas.

4. Materiales y Métodos
4.1. Preparación del conjunto de datos
Se utilizaron la base de datos ChEMBL [35] (versión 32) y la base de datos de objetivos terapéuticos (TTD) para seleccionar los objetivos clínicos relacionados con el VIH-1 y el VHB. Las palabras clave "HIV-1", "Human Immunodeficiency Virus type-1", "HBV" y "Hepatitis B Virus" se utilizaron como condiciones de recuperación. Luego, los resultados de la búsqueda se filtraron aún más si el número de compuestos relacionados con el objetivo era inferior a 30. Mientras tanto, los compuestos con una medida cuantitativa de actividad biológica (IC50, EC50, Ki o Kd) inferior o igual a 10 µM fueron etiquetado como "activo"; por el contrario, aquellos con una medida cuantitativa de actividad biológica superior a 10 µM se etiquetaron como "inactivos".
4.2. Extracción de características moleculares por red neuronal gráfica
El Simplified Molecular Input Line Entry System56 (SMILES) [55] de compuestos se descargó de la base de datos ChEMBL, y se utilizó la herramienta RDKit [56] para procesar estos compuestos que codifican SMILES para obtener gráficos moleculares y huellas dactilares de Morgan [34]. Luego, se adoptaron tres modelos de redes neuronales gráficas (GCN, GGNN, DMPNN) para aprender la representación de las estructuras moleculares, donde cada gráfico se compone de nodos y bordes. Los nodos se describen por el tipo de átomo, los elementos del átomo, el número de átomos adicionales, el número de electrones de valencia, las propiedades aromáticas y otras propiedades. La matriz de adyacencia representa la conectividad entre pares de átomos, independientemente de los enlaces simples o dobles. En la red neuronal convolucional de gráficos (GCN), los estados de los nodos del gráfico se actualizan mediante el método de incrustación: hi t=U(hi t−1 , mi t ), donde el i-ésimo nodo fue actualizado por el anterior estado del nodo hi t−1 con el estado del mensaje mi t . La red neuronal de gráficos cerrados (GGNN) utiliza las unidades recurrentes de puerta (GRU) [57] en el paso de propagación. Además, la MPNN dirigida contiene tres operaciones principales: paso de mensajes, actualización de nodos y lectura:

donde Mt es la función de mensaje, Ut es la función de actualización del nodo y N(i) es el conjunto de vecinos del nodo i en el gráfico G. La fase de lectura utiliza una función de lectura R para calcular el vector de características de todo el gráfico:

La función de mensaje, la función de actualización y la función de lectura son todas diferenciables. R opera en el conjunto de estados de los nodos y es insensible a la disposición de los nodos, lo que lleva a MPNN invariante al isomorfismo gráfico. En lugar de usar mensajes asociados con vértices (átomos) en la MPNN genérica, la MPNN dirigida (DMPNN) usa mensajes asociados con bordes dirigidos (enlaces) en las moléculas, lo que evitaría que los mensajes se tambaleen, es decir, para evitar bucles innecesarios en la trayectoria de paso del mensaje [58]. En nuestro estudio, DMPNN demostró un rendimiento superior en la extracción de propiedades moleculares.

4.3. Modelo de predicción multiobjetivo
En este estudio, para generar un clasificador multiobjetivo, se evaluaron tres modelos de conjuntos basados en redes neuronales gráficas que integran la representación gráfica y la representación Morgan de estructuras moleculares en 12 conjuntos de datos de clasificadores binarios. La capa de salida original de cada GNN se reemplazó por el árbol de decisión de aumento de gradiente (GBDT), que logró el mejor rendimiento de predicción entre todos los demás alumnos supervisados: SVM, RF y XGBoost. Luego, mediante la combinación de estos 12 clasificadores binarios, se generó el predictor multiobjetivo para identificar asociaciones de compuestos diana de VIH-1/VHB, que se denomina DMPNN más GBDT.
4.4. Métodos de aprendizaje automático
Para seleccionar la cooperación de la red neuronal gráfica en los dúos colaboradores, se evaluaron seis tipos de algoritmos de aprendizaje automático para el desempeño de la tarea de clasificación de objetivos binarios: bosque aleatorio (RF), máquinas de vectores de soporte (SVM), naive Bayes (NB) , árbol de decisión de aumento de gradiente (GBDT) y algoritmo de aumento de gradiente extremo (XGBoost). El ajuste de hiperparámetros de todos los métodos de aprendizaje automático se optimizó mediante la validación cruzada {{0}}fold en una búsqueda exhaustiva en un espacio limitado de hiperparámetros. En la clasificación RF, para una muestra determinada, cada árbol de decisión predice una etiqueta, y la predicción final de la muestra es la etiqueta de la mayoría de las predicciones de árboles, en las que el número de árboles de decisión se fijó en 10{{18 }}0. La clasificación SVM construyó la mejor separación de dos clases al maximizar la distancia (binario) entre instancias que pertenecen a diferentes clases. Para este algoritmo, un hiperparámetro de "costo" utilizado para controlar los errores fue optimizado por los valores candidatos 0.{{30}}1, 0.1, 1, 10, y 100. GBDT es miembro de la familia de refuerzo de aprendizaje conjunto, que itera utilizando un algoritmo de distribución directa. Suponiendo que el aprendiz fuerte de la iteración anterior es ft−1(x), la función de pérdida es L(y, ft−1(x)), y el objetivo de esta iteración es encontrar un aprendiz de árbol de decisión ht(x), minimizando la función de pérdida L(y, ft(x))=L(y, ft−1(x) plus ht(x)). Para este algoritmo, el número de árboles de decisión se fijó en 1000; la profundidad máxima del árbol de decisión se seleccionó entre 3, 5,10; la tasa de aprendizaje se muestreó a partir de (0, 1); y el número mínimo de muestras para dividir un nodo interno fue un candidato de 2, 3, 4 y 5. Finalmente, se ajustaron 3 parámetros XGBoost, es decir, la tasa de aprendizaje, la profundidad máxima y el peso mínimo del niño de 5 valores candidatos 0.01 , 0,05, 0,1, 0,15 y 0,2.

4.5. Métricas de rendimiento
Este estudio evaluó el marco propuesto DMPNN más GBDT con rendimiento de predicción con las otras dos redes neuronales gráficas en la validación de predicción de un solo objetivo. Se adoptaron la puntuación F1 y AUC para evaluar el rendimiento de cada modelo. La puntuación F1 es la media armónica de precisión (PPV) y recuperación (TPR), la puntuación AUC se define como el área bajo la curva de características operativas del receptor (ROC) para la métrica de rendimiento de clasificación. La curva ROC se define como la curva conectada de la tasa de verdaderos positivos (TPR) y la tasa de falsos positivos (FPR) de los puntos.

donde TP significa verdaderos positivos, TN significa verdaderos negativos, FP significa falsos positivos y FN significa falsos negativos, donde positivo y negativo se refieren a etiquetas de compuestos activas e inactivas, respectivamente.
Para evaluar el desempeño global de nuestro clasificador de objetivos múltiples combinado con 12 clasificadores binarios de un solo objetivo en la tarea de predicción de objetivos de VIH-1/VHB, la capacidad de identificar los compuestos activos conocidos entre las asociaciones de objetivos de compuestos conocidos NPV, TPR y la capacidad de no perder interacciones conocidas FNR se utilizó como métrica.

4.6. Desequilibrio de datos
Como se muestra en la Figura 2, los conjuntos de datos utilizados en este estudio están desequilibrados. Adoptamos el método de aprendizaje sensible al costo para aumentar la importancia de ciertas categorías en las tareas de entrenamiento de clasificación castigando los errores de clasificación en estas categorías especialmente, ajustando los parámetros en los métodos de aprendizaje automático. Para XGBoost, el parámetro "escala_pos_peso" se configuró en la proporción del número de casos negativos y casos positivos. En cuanto a SVM y RF, el parámetro "clase_peso" se estableció en "equilibrado". No existe un parámetro técnico para equilibrar los datos en el algoritmo NB. Sin embargo, para los modelos de árboles de decisión, que usan reglas de partición basadas en variables de clase para crear árboles de clasificación, pueden lograr un buen rendimiento al separar por la fuerza muestras de diferentes categorías. Por lo tanto, en GDBT, configuramos el parámetro "peso de la muestra_" de acuerdo con la proporción de muestras negativas y muestras positivas en diferentes conjuntos de datos, lo que reduce artificialmente el impacto de conjuntos de muestras grandes.
5. Conclusiones
En este artículo, propusimos un modelo de predicción basado en redes neuronales gráficas mediante la integración de un algoritmo de aprendizaje supervisado eficiente que es una excelente implementación de la estrategia de aumento de gradiente, GBDT. Combinando 12 conjuntos de datos de clasificación óptimos binarios, se construyó 1 modelo de predicción de objetivos múltiples. Con el fin de evaluar el rendimiento de nuestro modelo de conjunto de predicción de objetivos múltiples, se construyeron cinco conjuntos de datos externos para las evaluaciones de predicción, todos los cuales lograron el VPP y el TPR satisfechos, lo que significa una predicción relativamente precisa de objetivos potenciales en el VIH-1 y VHB. Además, nuestra investigación brindó la retrospectiva de medicamentos conocidos contra el VIH-1 y el VHB para detectar objetivos potencialmente posibles, también exploró nuevos compuestos para sus objetivos gemelos del VIH-1 y el VHB, lo que resultó en seis nuevos compuestos potenciales para tratar coinfección de VIH-1 y VHB. En conclusión, el modelo de red neuronal utilizado en este estudio podría identificar de manera efectiva los co-inhibidores para el VIH-1 y el VHB y tener la aplicación potencial para la detección virtual de medicamentos multiobjetivo para el tratamiento de la coinfección por VIH/VHB.
Contribuciones de los autores: LZ y YW concibieron y diseñaron el modelo de red gráfica e implementaron el estudio simulado y el análisis del conjunto de datos reales; YL escribió los códigos para los experimentos; LZ, YW y XC escribieron todo el manuscrito. Todos los autores han participado lo suficiente en el trabajo como para responsabilizarse del mismo. Todos los autores han leído y aceptado la versión publicada del manuscrito.
Financiamiento: Esta investigación fue financiada por la Fundación Nacional de Ciencias Naturales de China (No. 3161194 y No. 72271028).
Declaración de la Junta de Revisión Institucional: No corresponde.
Declaración de consentimiento informado: No aplicable.
Referencias
1. ONUSIDA. infoSIDA 2020. Disponible en línea:https://aidsinfo.unaids.org/(consultado el 12 de enero de 2022).
2. Bendavid, E.; joven, SD; Katzenstein, DA; Bayoumi, AM; Sanders, GD; Owens, DK Costo-efectividad del monitoreo del VIHEstrategias en entornos de recursos limitados: un análisis del sur de África.Arco. Interno. Medicina.2008, 168, 1910–1918. [Referencia cruzada] [PubMed]
3. Carlos, M.; Boyle, BA Exceso y acceso: la controversia continua sobre el VIH y la atención médica en África.SIDA Leer.2002, 12, 288–292. 4. Xia, H.; Wang, Y.; Sol, HL; Gao, LY; Cao, Y.; Zaongo, SD; Zeng, RN; Wu, H.; Zhang, MJ; Ma, P. Seguridad y eficacia deInmunoterapia alogénica con células asesinas naturales en personas que no responden inmunológicamente al virus de la inmunodeficiencia humana tipo 1: AReporte breve.Mentón. Medicina. j2020, 133, 2803–2807. [Referencia cruzada] [PubMed] 5. Zaongo, SD; Xia, H.; Ma, P. Estrategias y seguridad de la terapia génica del VIH: ¿Qué sabemos de las publicaciones recientes?SIDARdo.2020, 23, 195–202. [Referencia cruzada] [PubMed] 6. Falkenhagen, A.; Joshi, S. Estrategias genéticas para el tratamiento y la prevención del VIH.mol. El r. Ácidos nucleicos2018, 13, 514–533. [Referencia cruzada] 7. Janeway, California, Jr.; Travers, P.; Walport, M.; Shlomchik, MJInmunobiología: el sistema inmunológico en la salud y la enfermedad, 5ª ed.;Garland Science: Nueva York, NY, EE. UU., 2001.8. Hoffman, CJ; Thio, CL Implicaciones clínicas de la coinfección por VIH y hepatitis B en Asia y África.Lanceta Infectada. Dis.2007, 7, 402–409. [Referencia cruzada] 9. Singh, KP; Grúa, M.; Audsley, J.; Avihingsanon, A.; Sasadeusz, J.; Lewin, SR Coinfección por el virus de la hepatitis B y el VIH: epidemiología,Patogenia y Tratamiento.SIDA2017, 31, 2035–2052. [Referencia cruzada] 10. Cheng, Z.; Lin, P.; Cheng, N. Coinfección por VHB/VIH: Impacto en el desarrollo y tratamiento clínico de enfermedades hepáticas.Frente.Medicina.2021, 8, 713981. [Referencia cruzada]
Servicio de apoyo:
Correo electrónico:wallence.suen@wecistanche.com
Whatsapp/Tel: más 86 15292862950
Comercio:
https://www.xjcistanche.com/cistanche-shop






