Stop Fake News
Crean un detector de noticias falsas con 'machine learning'
Una estudiante de data science ha desarrollado el proyecto utilizando avanzadas herramientas de aprendizaje automático.
El detector es capaz de reconocer el tono satírico de un texto
Gracias al entrenamiento del modelo de aprendizaje automático, el detector es capaz de identificar patrones propios de las noticias satíricas y aplicarlos para detectar noticias falsas.
El sistema también adivina el periódico en que se publicó la noticia
La científica de datos ha conseguido que el modelo acierte el periódico al que pertenece la noticia en un 85% de los casos.
El algoritmo está basado en tecnología 'deep learning'
Con el propósito de que el usuario pueda valerse del modelo desarrollado de una forma sencilla y sin posibilidad de alterar el código, la científica de datos ha conectado el modelo Albert, entrenado con todos los datos de los periódicos, a una interfaz gráfica creada con la librería Streamlit de Python.
La data scientist también utilizó el modelo Doc2Vec, también conocido como Paragraph Vector, que es una técnica de aprendizaje automático desarrollada para representar documentos de texto en forma de vectores densos y continuos. «Es una extensión de Word2Vec que se utiliza para representar palabras como vectores distribuidos y capturar relaciones semánticas entre ellas», ilustra Sánchez. La idea detrás de Doc2Vec es representar de forma vectorial oraciones, párrafos o documentos completos, de forma similar a cómo Word2Vec genera vectores para las palabras.
Ya con un modelo base que, aunque era mejorable, proporcionaba predicciones con cierta solidez y era fácil de manejar, la analista investigó cuáles de los grandes modelos de lenguaje podian encajar mejor con las necesidades del proyecto. Una primera selección incluía Bert, DistilBert, Roberta y Xlnet, entre otros. Finalmente se decantó por DistilBERT, BERT-base y Albert. No con pocas dificultades, finalmente consiguió que funcionaran con algunos ajustes en el batch size del entrenamiento. «Los mejores resultados los conseguimos con el modelo Albert, a pesar de ser el más pequeño de los tres. Todos ellos resultaron más precisos que el modelo base (TF-IDF + Regresión Logística) y con menor sobreajuste, como cabía esperar», explica Sánchez.