FraudGPT superó a GPT 5.6 Sol en tareas de detección de fraude

FraudGPT ha demostrado durante este año ser el mejor LLM del mundo en materia de detección del fraude interno, aquel que sucede dentro de las organizaciones y el que está más relacionado con el riesgo de conducta (p.e. conflicto de interés) que con acciones genéricas, como por ejemplo, el acceso no autorizado.
Esta vez presentaremos el benchmark después de haber alcanzado el hito de certifiarnos en ISO/IEC 42001 y de haber contado con una auditoría independiente en la validación de las métricas
Como lo hicimos en los anteriores artículos, queremos ratificar que no estamos poniendo a prueba dos modelos generalistas. Estamos poniendo a prueba un super modelo generalista (GPT 5.6 Sol) contra un modelo especializado (FraudGPT) en la resolución de una tarea muy específica: la detección del fraude interno.
El resultado fue contundente: a pesar de que GPT 5.6 Sol es el modelo más poderoso del mundo, no tiene el suficiente entrenamiento para desempeñarse de forma sobresaliente en tareas relacionadas con el riesgo de conducta.
Cómo se evaluaron los modelos
La evaluación se realizó sobre 700 casos de prueba. Aproximadamente la mitad correspondía a situaciones confirmadas como positivas reales y la otra mitad a negativos reales, todos validados previamente por personas en contextos auténticos, no en escenarios artificiales. En otras palabras, no se trató de datos sintéticos, fabricados ni preparados para favorecer a alguno de los modelos. Los dos fueron expuestos por primera vez al mismo conjunto, bajo idénticas condiciones, con el mismo prompt y los mismos parámetros de ejecución.
Cuando hablamos de verdaderos negativos, nos referimos a interacciones que ya fueron verificadas como inocuas: casos que no despiertan sospechas, no representan riesgo y no contienen señales de una conducta posiblemente desleal. Por el contrario, los verdaderos positivos sí corresponden a hechos reales, consumados o en proceso de materializarse, donde ya existe un componente desleal claramente identificable.
En la práctica, las conductas desleales casi nunca se expresan de forma directa ni evidente. Una persona que busca sobornar a otra difícilmente va a decir “quiero sobornarte”. Lo habitual es que utilice frases ambiguas como “pórtate bien conmigo”, “cómo voy yo ahí”, o incluso que empiece preparando el terreno con regalos, favores o atenciones que más adelante generan una presión implícita de reciprocidad. Ahí es donde aparecen los llamados casos frontera: ejemplos especialmente difíciles, no solo para un ser humano, sino también para una inteligencia artificial y dentro de esos 700 casos evaluados, hay muchos de ese tipo.
Un caso frontera (también conocido como ejemplo límite o punto frontera) es una observación situada justo en el borde que separa dos clases dentro del espacio de decisión de un clasificador. Son situaciones en las que un LLM no tiene una respuesta obvia, porque tanto “SI” como “NO” pueden parecer razonables dependiendo del sesgo con el que se interprete el contexto. Por eso, la capacidad de comportarse bien frente a los casos frontera es una señal primordial: cuanto mejor lo haga un modelo allí, más cerca estará de capturar la complejidad real de la detección de conductas desleales.
El conjunto de evaluación incluye casos reales de fraude en industrias como seguros, salud, energía, infraestructura, aviación, retail, servicios financieros, oil & gas, telecomunicaciones y alimentos, ocurridos en México, Guatemala, Estados Unidos, Colombia, Perú, Chile, Ecuador, Panamá, Argentina y Uruguay.

FraudGPT no gana por accidente ni por una sola cifra aislada. Lidera con claridad y significa que cuando FraudGPT levanta una alerta lo hace con un nivel de limpieza y confianza que el modelo generalista no logró alcanzar en esta evaluación.
| Métrica | FraudGPT | GPT 5.6 Sol | Ventaja FraudGPT |
|---|---|---|---|
| Accuracy | 0.8657 | 0.7586 | +10.71 puntos |
| F1 clase SI | 0.8536 | 0.7732 | +8.04 puntos |
| F1 macro | 0.8648 | 0.7576 | +10.72 puntos |
| Precisión clase SI | 0.9073 | 0.7111 | +19.62 puntos |
| Recall clase SI | 0.8059 | 0.8471 | -4.12 puntos |
| Precisión clase NO | 0.8342 | 0.8237 | +1.05 puntos |
| Recall clase NO | 0.9222 | 0.6750 | +24.72 puntos |
Lo más interesante es que estamos hablando de un rival de frontera como GPT 5.6 en su versión Sol con el máximo nivel de razonamiento y aun así FraudGPT se mantiene por encima en las métricas que más importan para una operación seria: no solo detectar, sino detectar bien. La especialización bien construida sigue teniendo ventajas reales frente al generalismo más avanzado.
Entorno de entrenamiento
Para entrenar FraudGPT usamos un DGX Spark de NVIDIA con una GPU Blackwell de 128 GB de memoria. El framework de entrenamiento fue Unsloth y se usó llama.cpp para la cuantización en formato MXFP4. El script de entrenamiento lo desarrollamos en Python y el modelo resultante se corre en instancias Ollama alojadas en un cluster de Apple con arquitectura M-Ultra.
Impacto operativo
La única métrica en la que GPT 5.6 Sol fue bueno se concentró en Recall (SI), pero si analizamos bien las razones por las cuales fue bueno nos llevamos una sorpresa muy desagradable: generó muchísimo ruido (falsos positivos) y dentro de ese ruido, por pura suerte, encontró algunos casos verdaderamente positivos más que FraudGPT.
En el mundo real no gana el modelo que simplemente “marca más cosas”, sino el que encuentra señales útiles sin ahogar la operación en ruido. En ese equilibrio, FraudGPT brilla con una claridad impresionante. No necesita exagerar para rendir mejor: consigue un volumen muy alto de hallazgos útiles, controlando de manera extraordinaria la cantidad de revisiones innecesarias.

La personalidad de los modelos
GPT-5.6-Sol se empuja hacia la derecha del gráfico precisión-recall: prioriza recuperar más positivos, pero lo hace sacrificando precisión. FraudGPT, en cambio, combina un recall alto (0.8059) con una precisión extraordinaria (0.9073).
La posición de FraudGPT representa el lugar donde un sistema deja de ser “reactivo” y empieza a comportarse como un clasificador verdaderamente bien calibrado. FraudGPT no necesita inflar artificialmente el recall para parecer fuerte ni disparar alertas de más para demostrar sensibilidad.

Las matrices de confusión
En FraudGPT la diagonal principal es sólida, con 332 verdaderos negativos y 274 verdaderos positivos, con solo 28 falsos positivos. GPT-5.6-Sol consigue una recuperación ligeramente superior de positivos, pero lo paga con una caída fuerte en su capacidad de filtrar correctamente los negativos: solo acierta el 67.5% de los casos NO, frente al 92.2% de FraudGPT.
En fraude y compliance, ese 92.2% vale muchísimo y significa menos investigaciones innecesarias, menos desgaste humano y más confianza en el sistema. Un modelo generalista puede competir subiendo recall, pero un modelo especializado sigue ganando cuando lo que importa es el balance operativo real.

Un modelo generalista puede competir subiendo recall, pero un modelo especializado sigue ganando cuando lo que importa es el balance operativo real.
La seriedad y validez el Benchmark
Es una dudaa legítima y la queremos sustentar de la única forma que nos parece seria: es confiable porque el proceso es auditado por terceros. En NOFRAUD no medimos a FraudGPT “a puerta cerrada” ni ajustamos las cifras a conveniencia. Nuestra forma de evaluar el modelo está formalizada dentro de nuestro Sistema de Gestión de Inteligencia Artificial, certificado bajo la norma ISO/IEC 42001:2023 por Prescient Security, una firma auditora estadounidense independiente.
Todo esto significa que la manera en que calculamos accuracy, precisión, recall, F1 y las matrices de confusión que acabamos de mostrar no las inventamos para este artículo: está documentadas, controladas y sujetas a revisión externa. Adicional a todo esto, tenemos:
- Una metodología escrita antes de conocer los resultados: nuestro procedimiento de verificación y validación (V&V) define, por adelantado y por escrito, cómo se mide el modelo, qué métricas se usan, sobre qué datos y bajo qué condiciones. Este documento responde al Anexo A.6.2.4 de la norma, precisamente el que exige que un sistema de IA demuestre con evidencia que cumple su propósito.
- Un conjunto de evaluación blindado: los 700 casos sobre los que compite cada modelo son un holdout: datos reales que quedan completamente fuera del entrenamiento. Están balanceados al 50% entre casos éticos y no éticos, anonimizados y fueron etiquetados por examinadores de fraude certificados (ACFE CFE) con un 100% de concordancia entre anotadores: ni FraudGPT ni el modelo de OpenAI habían visto antes estos casos y ambos los enfrentaron bajo idénticas condiciones.
- Medición recurrente, no un experimento aislado: cada trimestre recalculamos formalmente todos los indicadores del modelo sobre el mismo conjunto de evaluación, con el mismo checkpoint de producción versionado y reportamos los resultados a la dirección como parte de nuestra revisión periódica. Es un control vivo, trazable y repetible, cualquier auditor puede seguir el hilo desde la métrica publicada hasta el dato que la originó.
- Todo lo revisó alguien más, no solo nosotros: el proceso pasó por una doble validación, una auditoría interna independiente dentro de nuestra organización y la auditoría externa de certificación de Prescient Security. En el reporte de certificación, tanto la cláusula de monitoreo, medición, análisis y evaluación como el control de verificación y validación fueron calificados como conformes, cumpliendo plenamente el requisito de la norma.
En otras palabras el benchmark que presentamos en este artículo se ejecutó siguiendo exactamente el mismo protocolo de medición que un auditor externo ya examinó y certificó. Se puede estar o no de acuerdo con nuestras conclusiones, pero los números salen de un proceso que fue construido, documentado y verificado para resistir precisamente ese tipo de escrutinio.
Referencias
(NOFRAUD, 2026) The Fraud Explorer y FraudGPT
Acerca de NOFRAUD
NOFRAUD es la compañía que desarrolla el software antifraude The Fraud Explorer y apoya a personas y empresas a enfrentar y solucionar sus retos en materia de fraude interno, corrupción y abuso corporativo. NOFRAUD ha creado la base de datos conductual de actos deshonestos más grande del mundo en Español e Inglés, que sirve para que la inteligencia artificial encuentre patrones sospechosos de corrupción al interior de las organizaciones.

Mejoramos la capacidad de las organizaciones incrementando sus beneficios, arrebatándole a los perpetradores la posibilidad de afectar negativamente los ingresos a través del fraude, la corrupción, el abuso corporativo y la generación de ambientes tóxicos.
Contacte conmigo en » jrios@nofraud.la y Visítenos en » www.nofraud.la.




