Toda evaluación de inteligencia artificial dentro de casa tropieza con la misma objeción: si ejecuto un modelo abierto en mi infraestructura, me quedo con un modelo peor que el de quien llama a la API del gran proveedor. La objeción es parcialmente cierta. El error no está en el hecho, está en la comparación. Se mide modelo contra modelo, cuando lo que decide es modelo contra tarea.
Esta es la segunda pieza de la serie porque, resuelta la pregunta sobre dónde queda el dato, la objeción que aparece justo después, en buena parte de las evaluaciones de Aptabit, es sobre calidad, y la respuesta honesta empieza admitiendo que la diferencia existe.
La diferencia entre el ranking y la tarea
Los modelos de frontera son mejores. Fueron entrenados con recursos que ninguna organización aislada reúne, y esa distancia es lo que miden las evaluaciones públicas de los propios fabricantes. Un proveedor que lo niegue pierde al interlocutor técnico en la tercera línea. Lo que esa diferencia no es, necesariamente, es decisiva para el trabajo que tu empresa va a poner en producción.
Esas pruebas miden techo de dificultad. El trabajo corporativo que la inteligencia artificial resuelve bien suele tener techo bajo. Clasificar un documento, extraer campos de un formulario, responder a partir de una base cerrada de conocimiento, todo eso tiene formato previsible y respuesta correcta conocida por alguien de la casa. En ese tipo de tarea, la pregunta no es qué modelo puntúa más, es si el área de negocio distingue las dos salidas en su propio material.
El criterio práctico es ese. Si la tarea tiene universo cerrado, formato estable y alguien capaz de decir si la respuesta es correcta, vale la pena medir si la diferencia todavía importa. Si la tarea es abierta y depende de conocimiento que no está en tu acervo, la diferencia aparece en cuanto el material real entra en la prueba.
Dónde la diferencia de modelo aparece de verdad
Una pieza que se detuviera en el párrafo anterior sería publicidad. Hay al menos tres familias de tarea en las que la diferencia de modelo pesa, y en las que ajustar la instrucción no suele resolver.
Razonamiento largo y abierto. Los problemas que exigen sostener una cadena de decisiones durante muchos pasos, sin respuesta única y sin una respuesta modelo con la cual comparar, son donde los modelos mayores tienden a separarse. Análisis exploratorio, plan en varias etapas, síntesis de material contradictorio. Si tu caso es ese, el modelo local cuesta calidad, y el costo es visible.
Código difícil y conocimiento poco frecuente. Escribir o depurar código no trivial, y responder sobre asuntos que dependen de conocimiento poco frecuente, siguen siendo territorio de los modelos de frontera. Aquí la decisión razonable suele ser usar el proveedor externo, con conciencia de que el contenido de ese flujo sale de tu red, asunto de la pieza anterior de esta serie.
Idiomas y dominios de cola larga. Los modelos menores suelen degradarse en lenguas poco representadas en el entrenamiento y en vocabulario técnico muy específico. El término sale mal y el error pasa desapercibido para quien no es del área. La degradación varía caso por caso y no se deduce del tamaño del modelo, así que este punto no se resuelve en el papel. Solo la prueba con tu propio material responde.
Existe además un costo que no es de calidad. Ejecutar el modelo dentro de casa cambia la factura por token por capacidad de cómputo instalada y por gente que sepa operarla. La cuenta no desaparece, cambia de lugar. La pregunta a hacer es quién opera esa capacidad y a qué costo, antes de la decisión y no después de ella.
Cómo montar la evaluación que decide la elección
Independientemente de que la elección lleve a Aptabit o a otro lugar, estas preguntas dicen si la evaluación se hizo de verdad:
- ¿Los casos salieron de mi acervo real, incluidos los malformados, o fueron elegidos para la demostración?
- ¿El criterio de acierto se escribió antes de que alguien viera las salidas?
- ¿Quien evaluó las salidas sabía qué modelo produjo cada una?
- ¿El tiempo de respuesta y el costo de operación se midieron junto con la calidad?
- ¿La prueba se repetirá con cada cambio de modelo o de versión?
La segunda es la más fácil de saltarse, y sin ella la evaluación tiende a confirmar aquello que ya se quería confirmar.
Por qué esta pieza viene justo después de la primera
El sitio dice que la plataforma ejecuta modelos locales o en la nube, sin dependencia de proveedor ni de modelo. Eso no es una lista de compatibilidad. Es la consecuencia de tratar el modelo como una pieza intercambiable, definida junto con el agente y explicitada flujo por flujo cuando el destino es un proveedor externo. Quien trata el modelo como centro ata el producto al nivel de un proveedor y a lo que ese proveedor decida sobre precio, disponibilidad y términos de uso. Quien lo trata como pieza necesita que sea lo bastante bueno para la tarea y que pueda cambiarse cuando deje de serlo.
Ir hasta el dato, en vez de pedir que el dato venga hasta nosotros, obliga a admitir que no todo modelo cabe donde el dato está. Una pieza más adelante en esta serie trata de dónde se ejecuta la inteligencia y de lo que cada esquema cobra por ello.