cs.AI · sep 2026
Benchy: towards a universal language for task-oriented AI benchmarks
El lenguaje, el modelo de objetos y el motor de ejecución de benchy.
El laboratorio de SURUS opera toda la stack, de la inferencia al sistema en producción. Lo que aprendemos vuelve como papers, modelos y herramientas abiertas.
Cada capa la construimos y la operamos nosotros. Por eso cada sistema llega más chico, más rápido y más seguro.
Dentro del perímetro de cada organización, con versionado y monitoreo. Ver productos
Cada versión se mide antes de salir, y medimos en público.
Modelos por tarea, abiertos cuando se puede.
Los modelos corren en nuestra infraestructura o en la del cliente.
GPUs donde entrenamos y donde corren los benchmarks que publicamos.
Cada sistema en producción es un experimento medido. Una corrección del equipo se vuelve un caso de examen; el examen mide al modelo siguiente; la versión que mejora vuelve a producción.
Los datos de cada organización quedan en su perímetro. Lo que publicamos es el método, las herramientas y los benchmarks.
Todo se mide
Buscamos el modelo que resuelve bien una tarea concreta y corre donde está el dato.
Lenguaje, voz y documentos para el español de la región. Los abiertos están en Hugging Face.
Extracción de campos desde texto, con validación de esquema.
Extracción de campos desde imágenes de facturas.
Reconocimiento de habla para el español rioplatense.
Whisper ajustado para el español de América Latina.
Síntesis de voz con acento argentino y chileno, sobre Llama 3.2 3B.
XTTS-v2 con acento argentino. Probalo en el playground.
Llama 3.1 ajustado para el español, en varias cuantizaciones (f16, int4, bnb 4-bit, GGUF).
Corpus abiertos de habla argentina (Common Voice, OpenSLR, PRESEEA, CORdeBA) unificados en un formato común.
Los benchmarks públicos se construyen sobre todo en inglés y sobre contexto anglosajón. Una organización necesita saber si un modelo funciona para su tarea, con sus datos y en su idioma.
benchy es nuestro lenguaje y motor para benchmarks orientados a tareas. LatamBoard es su cara pública.
B = (P, S, D)
benchmark: task: extract domain: finance language: es program: input: text: string output: invoice_number: string date: date supplier: name: string tax_id: string total: float scoring: # lo que le importa al negocio pesa más weights: invoice_number: 1 date: 1 supplier: name: 1 tax_id: 0 total: 5 aggregator: weighted_mean data: path: ./exam.jsonl
El lenguaje, el modelo de objetos y el motor de ejecución de benchy.
La capa de evaluación que le falta a América Latina para desarrollar IA propia. Base de LatamBoard.
El gap de Llama-3.1-8B-Instruct se triplica cuando se lo evalúa sobre conocimiento latinoamericano en lugar de anglosajón: de 13,5 a 30,6 puntos.
Proponé una tarea, un dataset o un modelo para LatamBoard. Todo es abierto.
Motor de benchmarks para evaluar sistemas de IA en tareas concretas.
Copiloto que traduce una tarea del negocio en un benchmark listo para correr.
Sesiones de agentes que exploran soluciones, las puntúan y dejan lo aprendido en un registro durable.
Fork de lm-evaluation-harness con las tareas de LatamBoard.
Datasets de y sobre América Latina, con pipelines abiertos.
Datasets abiertos de habla argentina.
Bench Press, la newsletter donde contamos cómo construimos benchy, y la comunidad de Discord.
Buscamos gente que quiera entrenar modelos y verlos funcionar en producción.
Contanos qué estás investigando o qué te gustaría entrenar.