Cómo una empresa en Colombia le gana a las IAs más poderosos en la detección de fraude?

Es una pregunta legítima y honestamente nosotros mismos nos la hacemos a veces cuando nos invade el síndrome del impostor. Cómo es posible que un modelo entrenado por un equipo en Colombia, con una sola GPU, supere a los modelos más poderosos de OpenAI y Anthropic en una tarea tan delicada como detectar el fraude interno?
Con mucha probabilidad, FraudGPT puede seguir siendo el LLM más poderoso del mundo sin importar cuán potentes se vuelvan los modelos generalistas de OpenAI y Anthropic
La respuesta está en entender bien tres conceptos que son relevantes a la hora de hablar de un LLM: el pre-entrenamiento, el RLHF y el SFT. Cuando uno comprende cómo funciona realmente cada uno, deja de parecerse a algo increible (o muchos dirán, humo) y se empieza a parecer a algo alcanzable de forma muy razonable.
En este artículo queremos abrir la caja negra, no para presumir, sino porque creemos que entender “el cómo” es la mejor forma de confiar en el “qué”.
Dónde vive la inteligencia de una IA
Existe un malentendido muy extendido, la gente cree que un modelo como GPT 5.6 “aprende todo” en un solo proceso. En realidad, un LLM moderno se construye en etapas muy distintas y cada una hace algo diferente.
El pre-training, donde el modelo se llena de conocimiento: el pre-entrenamiento es la etapa donde el modelo se vuelve inteligente. Aquí se le exponen billones de palabras provenientes de internet, libros, código y artículos. El modelo no memoriza frases, mas bien aprende a predecir la siguiente palabra una y otra vez y en ese proceso interioriza la gramática, los hechos del mundo, las estructuras de razonamiento y las relaciones estadísticas entre conceptos. Es importante entender esto, todo el conocimiento del modelo entra en el pre-training.
Cuando un LLM “sabe” de derecho, medicina o finanzas, es porque absorbió esos patrones en esta fase. Es la etapa más cara, la que cuesta cientos de millones de dólares y requiere de GPUs en centros de datos enteros. Es también la razón por la cual solo un puñado de empresas en el mundo puede hacer un modelo fundacional desde cero. Nosotros no hacemos esta etapa y no tendría sentido hacerla, partimos de un modelo fundacional ya pre-entrenado (en nuestro caso, GPT-OSS 20B, el modelo abierto de OpenAI) que ya “sabe” español, inglés y entiende el mundo. La inteligencia base ya está ahí.
El SFT y el RLHF, donde el modelo se vuelve útil: si el pre-training es donde el modelo se vuelve inteligente, el post-entrenamiento es donde se vuelve útil. Aquí hay dos técnicas que debemos conocer:
- SFT (Supervised Fine-Tuning): es donde se le muestran al modelo demostraciones, es decir, pares de entrada y salida esperada. “Dado este texto, esta es la respuesta correcta”. El modelo aprende por imitación, ajustando su comportamiento hacia los ejemplos que le damos. Es lo que hacemos nosotros con FraudGPT, le mostramos un chat o correo real y la clasificación correcta (sospechoso / no sospechoso) con su riesgo.
- RLHF (Reinforcement Learning from Human Feedback): aquí no se le muestran respuestas correctas, sino preferencias. Se le presentan dos respuestas y un humano indica cuál es la mejor. Sirve para alinear el tono, la seguridad y la utilidad general en tareas abiertas donde no hay una única respuesta correcta.
La analogía que más nos gusta esta: el pre-training es la universidad (donde uno adquiere todo el conocimiento general), el SFT es la especialización (donde uno aprende a aplicar ese conocimiento a una tarea concreta) y el RLHF es el pulido de modales (cómo comunicar bien lo que uno sabe). Un modelo generalista como GPT-5.6 tuvo una universidad extraordinaria, pero nunca hizo la especialización en fraude interno.
No necesitamos ganarle a OpenAI o Anthropic en la universidad. Solo necesitamos ganarle en la especialización y esa es una pelea mucho más justa de lo que parece, no es fácil pero no requiere tener el mismo poder y dinero que requeriría competir en el pre-training.
El dataset es el verdadero tesoro
Si hay una sola cosa que queremos que el lector se lleve de este artículo, es esta: en el mundo del fine-tuning, el dataset vale más que el modelo.
Lo que cuesta un buen dataset: según un análisis reciente sobre anotación de datos para fine-tuning, producir apenas 600 anotaciones de alta calidad para RLHF puede costar alrededor de 60.000 dólares, aproximadamente 167 veces más que el costo de cómputo equivalente para entrenar con esos datos. El dato humano de calidad es dramáticamente más caro que las GPU. De hecho, el mismo campo lo confirma a gran escala, entre 2023 y 2024 el costo de la anotación de datos creció 88 veces, mientras el costo de cómputo apenas subió 1.3 veces.
Hoy, el dato humano de calidad cuesta cerca de tres veces más que el cómputo marginal para entrenar un modelo frontera. Las grandes empresas de IA gastan del orden de 1000 millones de dólares al año cada una solo en datos provistos por humanos. Por qué contamos esto?, porque cuando alguien pregunta “cómo una empresa pequeña le gana a un gigante?”, la respuesta honesta es: porque la ventaja competitiva ya no está en el tamaño del modelo, sino en la calidad y autenticidad del dataset. Y ahí el tamaño de la empresa importa mucho menos que la calidad de los datos que uno haya sabido acumular.
Datos reales vs. datos artificiales: aquí está nuestro mayor diferenciador y es un principio de diseño innegociable en FraudGPT, todos nuestros datos de entrenamiento son naturales. Provienen de comunicaciones reales, escritas por empleados reales, en entornos corporativos reales, no usamos datos sintéticos ni artificialmente aumentados. En el fraude, la realidad es más rara y más sutil que cualquier cosa que se pueda inventar. Una persona que busca sobornar a otra casi nunca dice “quiero sobornarte”. Dice cosas como “pórtate bien conmigo” o “cómo voy yo ahí”. Ese tipo de ambigüedad, esos casos frontera, no se pueden fabricar en un laboratorio, solo se capturan cuando uno tiene años de casuística real.
Un dataset sintético produciría un fraude “de manual”, idealizado, que no se parece a cómo hablan los defraudadores de verdad. Nuestro conjunto, en cambio, contiene fraudes reales de industrias como seguros, salud, energía, aviación, retail y oil&gas, ocurridos en México, Colombia, Perú, Chile, Argentina y una decena de países más y cada ejemplo fue etiquetado por examinadores de fraude certificados (ACFE CFE). Esa es una ventaja que ni todo el presupuesto de OpenAI puede comprar fácilmente, porque no es cuestión de dinero, es cuestión de acceso a la realidad conductual del fraude latinoamericano.
Por qué fallan los grandes
Por qué un modelo tan poderoso como GPT-5.6 Sol genera tantos falsos positivos al detectar fraude interno? La respuesta tiene un nombre dentro de la jerga del machine learning: correlación espuria.
Una correlación espuria es cuando un modelo usa una señal superficial como atajo para predecir algo sin entender la relación causal real. En nuestro caso, el fenómeno más claro es que los modelos generalistas tienden a confundir el lenguaje soez o los insultos con indicios de fraude. Ven una grosería en un chat y levantan la alerta, cuando en realidad se trata simplemente de un empleado molesto usando un lenguaje fuerte, sin ninguna intención deshonesta.
Esto ocurre por tres causas que se superponen:
- El pre-training aprende que “tóxico” se parece a “malo”: los modelos fundacionales se entrenan con textos masivos de internet, donde el lenguaje ofensivo co-ocurre estadísticamente con contextos negativos como estafas, amenazas, spam, acoso. Con el tiempo, el modelo aprende la asociación difusa de que “insulto” entra en el vecindario de lo “malo/peligroso”. El problema es que el modelo no distingue entre dos cosas que para un examinador de fraude son completamente diferentes, lo tóxico (una forma de hablar) y lo fraudulento (un acto con intención). Para el modelo generalista, ambos caen en el mismo saco de “contenido problemático”.
- El “impuesto de alineación” del RLHF: el sesgo del pre-training no solo se queda, el RLHF de seguridad lo amplifica. Durante la alineación, a estos modelos se les entrena para penalizar el contenido tóxico y aprenden a tratar el lenguaje soez como una bandera roja. Esto genera un fenómeno documentado llamado sobre-marcado (over-flagging) que es cuando el modelo marca como problemáticas cosas perfectamente inofensivas, solo porque hacen “match” con su entrenamiento de seguridad. La investigación muestra que la correlación entre el nivel de seguridad de un modelo y su tendencia al sobre-rechazo es altísima. Traducido a nuestro mundo, el modelo generalista está calibrado para ser hipersensible a las groserías y esa hipersensibilidad se convierte en falsos positivos de fraude.
- El modelo vive en otra distribución (distribution shift): el modelo generalista fue optimizado para la distribución “promedio” de internet, no para la realidad específica de los chats y correos corporativos. En nuestro dominio, un insulto es estadísticamente neutral respecto al fraude, aparece tanto en casos deshonestos como en casos totalmente inocuos, pero el modelo generalista llega con una expectativa equivocada y heredada de otra distribución. Esa discrepancia es precisamente donde los LLM pierden robustez y empiezan a equivocarse.
Si OpenAI y Anthropic hicieran frente a estos problemas, crearían otro problema mas grande y es que podrían generar modelos con una personalidad agresiva, peligrosa y no deseada por la sociedad.

Cómo lo corrige FraudGPT
Nuestro SFT sobre datos reales es exactamente la respuesta a la corrección a este problema. Con +15mil ejemplos reales y diversos, donde los insultos aparecen en ambas clases, a veces acompañando un fraude y a veces en un simple desahogo inofensivo, le enseñamos al modelo que el insulto es una señal irrelevante, no un predictor de fraude. Lo forzamos a mirar lo que de verdad nos importa, el contexto, la intención y el patrón conductual del Triángulo del Fraude (presión, oportunidad, racionalización).
En nuestro último benchmark auditado, FraudGPT alcanzó una precisión del 90.73% frente al 71.11% de GPT-5.6 Sol y clasificó correctamente el 92.22% de los casos NO frente al 67.5% del modelo generalista. En otras palabras, donde el modelo más poderoso del mundo se ahogaba en falsos positivos, nuestro modelo especializado mantuvo la calma. No porque sea “más inteligente” en general, porque no lo es, sino porque hizo la especialización que el otro nunca hizo.
Cómo sabemos que es cierto?
Llegados a este punto, un lector escéptico podría pensar “todo esto suena muy bien, pero al final es la empresa hablando bien de sí misma”. Es una duda legítima y la queremos responder de la única forma que nos parece seria, no pedimos que nos crean, pedimos que entiendan la factibilidad y razonabilidad del proceso.
Todo lo que hemos descrito en este artículo no ocurre “a puerta cerrada”, está formalizado dentro de nuestro Sistema de Gestión de Inteligencia Artificial, certificado bajo la norma ISO/IEC 42001:2023 por Prescient Security, una firma auditora estadounidense independiente y somos, hasta donde sabemos, una de las primeras empresas de la región en obtener esta certificación específica para sistemas de IA que detectan el fraude.
Qué significa esto en la práctica y por qué le da peso a todo lo anterior?
- La metodología se escribe antes de conocer los resultados: nuestro procedimiento de verificación y validación (V&V) define, por adelantado y por escrito, cómo se mide el modelo, qué métricas se usan y bajo qué condiciones. Este control responde directamente al Anexo A.6.2.4 de la norma, el que exige demostrar con evidencia que un sistema de IA cumple su propósito.
- El conjunto de evaluación está blindado: los casos sobre los que compite cada modelo son un holdout, datos reales quedan completamente fuera del entrenamiento, balanceados al 50% entre casos éticos y no éticos, anonimizados y etiquetados por examinadores de fraude certificados (ACFE CFE) con concordancia total entre anotadores. Ni FraudGPT ni el modelo generalista habían visto esos casos antes.
- La medición es recurrente, no un experimento aislado: cada trimestre recalculamos formalmente todos los indicadores sobre el mismo conjunto con el mismo checkpoint de producción versionado y reportamos a la dirección. Es un control vivo y trazable, cualquier auditor puede seguir el hilo desde la métrica publicada hasta el dato que la originó.
- Todo lo revisó alguien más: el proceso pasó por una doble validación, una auditoría interna independiente y la auditoría externa de certificación de Prescient Security. Tanto la cláusula de monitoreo y medición como el control de verificación y validación fueron calificados como conformes.
La correlación espuria de la que hablamos es exactamente el tipo de sesgo silencioso que un sistema de gestión de IA bien auditado está diseñado para detectar, medir y controlar. La ISO/IEC 42001 es la disciplina que nos obliga a demostrar, con evidencia y ante terceros, que cuando decimos “reducimos los falsos positivos”, ese número salió de un proceso construido para resistir el escrutinio.
Conclusión
Cuando entendemos que el conocimiento vive en el pre-training, que la utilidad se construye con SFT y RLHF, y que el verdadero tesoro es un dataset real y bien curado, la pregunta del título se responde sola. Una empresa pequeña en Colombia puede ganarle a los gigantes en una tarea específica no porque tenga más poder, sino porque tiene el enfoque, los datos correctos y la disciplina para tratar el problema con la seriedad que merece.
Los modelos generalistas son extraordinarios. Pero el fraude interno no se detecta con hipersensibilidad al lenguaje soez ni con atajos estadísticos heredados de internet. Se detecta entendiendo la conducta humana. Y esa, con humildad pero con evidencia, es la especialidad que llevamos años construyendo.
Referencias
(SecondTalent, 2026) Data Annotation for LLM finetuning
Acerca de NOFRAUD
NOFRAUD es la compañía que desarrolla el software antifraude The Fraud Explorer y apoya a personas y empresas a enfrentar y solucionar sus retos en materia de fraude interno, corrupción y abuso corporativo. NOFRAUD ha creado la base de datos conductual de actos deshonestos más grande del mundo en Español e Inglés, que sirve para que la inteligencia artificial encuentre patrones sospechosos de corrupción al interior de las organizaciones.

Mejoramos la capacidad de las organizaciones incrementando sus beneficios, arrebatándole a los perpetradores la posibilidad de afectar negativamente los ingresos a través del fraude, la corrupción, el abuso corporativo y la generación de ambientes tóxicos.
Contacte conmigo en » jrios@nofraud.la y Visítenos en » www.nofraud.la.




