He pasado más de 20 años utilizando estadística y aprendizaje automático para combatir el fraude.
Cuando recién comencé mi carrera, el aprendizaje automático aún no era una parte fundamental de las herramientas del equipo antifraude. En aquel entonces, la mayoría de las empresas dependían de métodos tradicionales como WAFs, CAPTCHAs y bases de datos estáticas para bloquear actividades sospechosas.
Hoy en día, el aprendizaje automático y la IA realizan gran parte del trabajo pesado cuando se trata de detectar patrones de fraude, identificar anomalías y determinar puntuaciones de riesgo. Los sistemas basados en aprendizaje automático son mucho más eficaces a la hora de responder a amenazas cambiantes en tiempo real, por lo que la mayoría de las organizaciones ya lo utilizan o están considerando utilizar aprendizaje automático para la prevención del fraude. Los algoritmos de aprendizaje automático pueden encargarse de una amplia variedad de tareas, analizar datos, encontrar patrones y ayudar en la toma de decisiones basadas en volúmenes enormes de datos.
Con todo el revuelo que hemos visto en torno a la IA generativa y ChatGPT, me han preguntado si la GenAI va a reemplazar el aprendizaje automático en la prevención del fraude y cuándo es mejor usar aprendizaje automático frente a GenAI.
Esta es mi opinión 👇.
Conclusiones clave
- La GenAI no reemplazará el aprendizaje automático en la prevención del fraude en un futuro cercano. La GenAI no es ideal para detectar riesgos de fraude en conjuntos de datos tradicionales. Los modelos de aprendizaje automático supervisados y no supervisados funcionan mucho mejor para la prevención del fraude.
- Para el aprendizaje supervisado, los árboles de decisión potenciados mediante gradiente son el modelo de trabajo principal y, por lo general, es todo lo que necesitas. Si quieres crear modelos basados en eventos para señalar secuencias de eventos anómalas y detectar apropiaciones de cuentas, entonces los modelos de Memoria a Largo Corto Plazo (LSTM) también son suficientes.
- Los modelos de aprendizaje no supervisado como K Nearest Neighbors (KNN) o los bosques de aislamiento para la detección de anomalías son excelentes para agrupar datos y encontrar redes de fraude.
- La IA generativa puede ser una gran copiloto para las operaciones de fraude y cumplimiento. Puedes usarla para analizar y resumir grandes conjuntos de datos no estructurados. También puede ayudar a crear reglas, gestionar disputas o incluso presentar reportes de actividad sospechosa.
- Las tasas de fraude están aumentando un 30% interanual y las presentaciones de SAR están creciendo un 15% interanual. La plantilla y los presupuestos de TI no pueden crecer tan rápido como lo han hecho los volúmenes de SAR y las tasas de fraude. GenAI podría ser la mejor manera de mantenerse al día con el auge de las presentaciones de fraude y SAR.
- GenAI tendrá que resolver algunos desafíos importantes de calidad de datos y gobernanza para evolucionar más allá de los copilotos.
- La combinación ideal es humanos + reglas + ML + GenAI.
¿Cómo se utiliza el aprendizaje automático en la prevención del fraude?
Los sistemas de prevención de fraude basados en aprendizaje automático utilizan algoritmos para analizar grandes volúmenes de datos e identificar indicios de fraude, como patrones sospechosos, actividad anómala y relaciones entre puntos de datos.
Al utilizar una combinación de datos históricos y en tiempo real, los sistemas de prevención de fraude basados en aprendizaje automático pueden predecir la probabilidad de fraude con un alto grado de precisión. Además, suelen volverse más eficaces con el tiempo. A medida que supervisan nuevos escenarios de fraude, aprenden rápidamente los patrones y se adaptan para detener estas amenazas.
Para hacer esto de manera eficaz, los modelos de aprendizaje automático deben entrenarse y perfeccionarse utilizando “características”. Estos atributos y predictores enseñan a los algoritmos a reconocer patrones y hacer predicciones. Invertimos mucho tiempo en entrenar modelos y crear características en Sardine. Nuestro equipo ha creado más de 4.000 características de detección de fraude y normalmente lanzamos entre 250 y 500 características nuevas cada trimestre.
¿Cómo se utiliza la IA generativa en la prevención del fraude?
La IA generativa sigue siendo una tecnología relativamente nueva en la prevención y detección del fraude. Hoy en día, su mejor uso es como copiloto para las operaciones de fraude y cumplimiento normativo:
- Análisis y resumen de grandes conjuntos de datos no estructurados
- Automatizar tareas administrativas con demasiadas variables para las herramientas de RPA
- Responder preguntas sobre por qué se ha activado una regla
- Ayudarte a crear reglas en tu sistema de puntuación de riesgos
- Preparar y presentar pruebas para disputas de pago
- Redacción de narrativas SAR y presentación de informes de actividad

Paradójicamente, hemos observado que los estafadores son algunos de los mayores usuarios de GenAI en la actualidad. Utilizan estos LLM para escalar sus estafas y hacer que sus tácticas sean más efectivas.
Algunos ejemplos incluyen:
- Redactar correos electrónicos y mensajes de phishing con gramática perfecta
- Superponer rostros (deepfakes) en videos y documentos de identidad durante el proceso de incorporación
- Uso de clonación de voz para eludir la autenticación a través del soporte telefónico
- Automatizar las comunicaciones para distintas estafas
Este artículo de Forbes profundiza en cómo se está utilizando la IA para potenciar el fraude.
¿Qué herramienta es mejor para la prevención del fraude?
Como ocurre con muchas cosas en la vida, la gente quiere reducirlo a una respuesta binaria: sí o no, verdadero o falso. La realidad es que aquí no hay una única respuesta correcta; se trata de elegir la herramienta adecuada para cada caso.
1. El aprendizaje automático es mejor que la IA para la detección de fraudes
La GenAI es transformadora en muchos ámbitos. Sin embargo, los modelos de aprendizaje automático supervisado y no supervisado funcionan muy bien para la prevención del fraude. De forma natural, son mucho más eficaces a la hora de manejar grandes modelos estadísticos y ofrecer respuestas con un mayor nivel de confianza.
Los modelos de IA generativa son milagros de la ingeniería moderna y resultan increíblemente útiles en todo el espectro de riesgos.
Los modelos tradicionales podrían considerar que palabras como “Ford” y “granja” son mucho más similares que “Ford” y “coche”. El modelo construye una comprensión semántica más profunda del lenguaje basándose en el corpus de predicción de la siguiente palabra con el que ha sido entrenado.
Esto es fantástico cuando intentas generar texto nuevo con significado o comprender un escenario complejo y resumirlo.
Sin embargo, hoy en día, la GenAI puede ser costosa y lenta. Aunque existen formas de mitigar ambos desafíos, los tipos de modelos actuales siguen siendo más eficientes y probablemente la herramienta adecuada para modelar el riesgo de fraude a partir de señales transaccionales, de usuario, de dispositivo o de comportamiento.

La GenAI y los modelos de lenguaje grandes también tienen la costumbre de alucinar. Esto es cierto tanto para los modelos de código abierto, como para los de código cerrado y los propietarios que utilizan arquitecturas de transformadores para crear significado semántico a partir de grandes conjuntos de datos con incrustaciones.
La alucinación puede ser una característica, no un fallo; es creatividad y resolución de problemas, y puede abordar cuestiones más complejas. El equipo antifraude lo sabe bien, ya que es en lo que los equipos de operaciones pasan gran parte de su tiempo.
La GenAI no es tan potente en el procesamiento numérico bruto y la modelización estadística como las técnicas de aprendizaje automático existentes.
El autor Ethan Mollick describe a la GenAI y a los LLM como “personas bastante buenas”. Son creativos y buenos para resolver problemas, pero no siempre son 100 % precisos.
Los modelos de aprendizaje automático pueden ser mucho más sólidos cuando buscamos realizar análisis estadísticos de conjuntos de datos transaccionales, de usuarios o basados en la web para identificar patrones de comportamiento o actividad.
2. El aprendizaje automático ofrece la mejor relación calidad-precio.
La mayoría de las instituciones financieras y los comercios apenas han empezado a explorar todo lo que la IA puede hacer.
Los equipos de fraude y cumplimiento saben que necesitan esta capacidad, pero a menudo carecen de la inversión o de los recursos de ingeniería para desarrollar los modelos (con una o dos excepciones notables). Incluso en las empresas más grandes y con mejores prácticas que vemos, los modelos están muy lejos de la escala que cabría esperar en las grandes tecnológicas o en la publicidad digital. Hay un enorme potencial por desbloquear al acceder a capacidades de aprendizaje automático a gran escala de forma llave en mano.
El aprendizaje automático logrará mejoras sustanciales de rendimiento en la prevención, detección y reporte de fraudes o riesgos de cumplimiento. Hoy en día, la mayoría de los modelos son pequeños, dependen de conjuntos de datos limitados y el equipo antifraude se ve obstaculizado por el escaso acceso a datos externos.
En el aprendizaje supervisado, el secreto mejor guardado entre los profesionales de machine learning es que los árboles de decisión con gradiente reforzado son el modelo de batalla. Además, los GBDT siempre han demostrado ser muy sólidos con datos estructurados, donde la historia de prueba y error ya está incorporada. También vemos modelos CNN y GNN en sectores más avanzados como los pagos en tiempo real (RTP) y el fraude en criptomonedas.
Si quieres crear modelos basados en eventos para señalar secuencias de eventos anómalas y detectar tomas de control de cuentas, entonces los modelos secuenciales también son suficientes.
Por último, los modelos de aprendizaje no supervisado como K Nearest Neighbors (KNN) o los bosques de aislamiento para la detección de anomalías son suficientes para la agrupación. Con este conjunto de datos de primer orden, los métodos de graficación ayudan a encontrar redes de fraude.
3. GenAI es un gran copiloto para las operaciones de fraude y cumplimiento
Creo que el "fruto fácil de alcanzar" de GenAI es servir como copiloto para las operaciones de fraude y cumplimiento. Las organizaciones destinan entre el 10 % y el 30 % de su personal a actividades relacionadas con el cumplimiento.
Hoy en día, los equipos de fraude y cumplimiento intentan mantenerse al día con volúmenes cada vez mayores de fraudes y SARs sin contar con un presupuesto más amplio. Gran parte del trabajo es manual, y estas tareas suelen consistir en resúmenes de datos repetitivos o en rastrear grandes conjuntos de datos. Esto los obliga a concentrarse únicamente en los casos más graves.

Un modelo de lenguaje grande puede realizar hasta el 90% del trabajo administrativo tedioso, lo que les permite detectar y prevenir mucha más actividad fraudulenta y presentar muchos más ROS sin necesidad de aumentar la plantilla.
La IA generativa está hecha a la medida para esto y, en Sardine, ya tenemos varios casos de uso en producción.
Copiloto del director de riesgos | El director de riesgos puede hacer preguntas como: «¿Cuál es el estado general de salud de mi plataforma hoy?» |
Copiloto de analista | Los analistas pueden solicitar recomendaciones para una regla |
Copiloto de operaciones | Encadena las distintas tareas que intervienen en la revisión de un caso |
Texto a SQL | Escribe tu regla de monitoreo de transacciones en lenguaje natural y nosotros generamos el SQL adecuado |
4. El gobierno y la calidad de los datos son clave para que la IA generativa sea efectiva
Puedo imaginar numerosas áreas en las que los LLM podrían lograr mejoras significativas en el rendimiento siendo “más que” un copiloto.
Un ejemplo en el que los LLM pueden potencialmente tener un mayor impacto es en la detección de toma de control de cuentas mediante el modelado de secuencias de eventos. Pero a menudo, el problema no es que no tengamos una buena técnica de modelado disponible, sino más bien la falta de buenos datos etiquetados: en mi experiencia, ninguna empresa recopila etiquetas realmente fiables sobre qué inicios de sesión fueron verdaderas tomas de control de cuentas y cuáles no.
Primero resolvamos eso y luego lo demás seguirá con bastante facilidad.
Aprendizaje automático vs. GenAI para la prevención del fraude
En resumen, está claro que tanto el aprendizaje automático como la genAI van a desempeñar un papel crucial en la prevención del fraude. Es Y, no O. Aquí tienes una buena tabla que resume las diferencias elaborada por la gente de Techopedia:

Con el tiempo, sí creo que las herramientas de GenAI nos sorprenderán haciendo gran parte de lo que hace el equipo antifraude actualmente . Creatividad, resolución de problemas, generación de nuevas reglas y su aplicación.
Pero no creo que tengamos que preocuparnos por ser reemplazados por la IA. Estos copilotos simplemente nos harán más productivos y liberarán nuestro tiempo y recursos para que podamos centrarnos en tareas de mayor valor.
La combinación ideal es humano + reglas + ML + IA generativa.
Me encantaría escuchar a personas más informadas que yo sobre casos de uso de la IA generativa en la detección de fraude y sobre qué ha funcionado y qué no.

