SURUS

Entrenamos, medimos
y publicamos

El laboratorio de SURUS opera toda la stack, de la inferencia al sistema en producción. Lo que aprendemos vuelve como papers, modelos y herramientas abiertas.

La stack

Integrados de punta a punta

Cada capa la construimos y la operamos nosotros. Por eso cada sistema llega más chico, más rápido y más seguro.

NVIDIA InceptionOn-premiseNube privada
Sistemas integrados
Productos en producción

Dentro del perímetro de cada organización, con versionado y monitoreo. Ver productos

Evaluación
benchy · LatamBoard

Cada versión se mide antes de salir, y medimos en público.

Modelos
Entrenamiento y destilación

Modelos por tarea, abiertos cuando se puede.

Inferencia
Servido propio

Los modelos corren en nuestra infraestructura o en la del cliente.

Cómputo
Nodo propio en Argentina

GPUs donde entrenamos y donde corren los benchmarks que publicamos.

El ciclo

De producción al laboratorio

Cada sistema en producción es un experimento medido. Una corrección del equipo se vuelve un caso de examen; el examen mide al modelo siguiente; la versión que mejora vuelve a producción.

Los datos de cada organización quedan en su perímetro. Lo que publicamos es el método, las herramientas y los benchmarks.

Todo se mide

Resultados

Modelos propios, medidos en público

Buscamos el modelo que resuelve bien una tarea concreta y corre donde está el dato.

0,919extracción estructurada, primer puesto entre 39 sistemas
0,975extracción desde imágenes de facturas, primer puesto entre 5
0,7 %tasa de alucinación de surus-extract al extraer campos
47sistemas evaluados en LatamBoard
Extracción estructurada · LatamBoard1.º de 39 · más es mejor
SURUSOtros sistemas
Extracción desde imágenes · facturasmás es mejor
Puntaje de calidad de extracción.
Tasa de alucinaciónmenos es mejor
Excluye sistemas sin extracciones válidas.
Evaluación

Un benchmark es un programa

Los benchmarks públicos se construyen sobre todo en inglés y sobre contexto anglosajón. Una organización necesita saber si un modelo funciona para su tarea, con sus datos y en su idioma.

benchy es nuestro lenguaje y motor para benchmarks orientados a tareas. LatamBoard es su cara pública.

B = (P, S, D)

benchmark.yaml · adaptado de examples/invoicesbenchy 1.0
benchmark:
  task: extract
  domain: finance
  language: es

program:
  input:
    text: string
  output:
    invoice_number: string
    date: date
    supplier:
      name: string
      tax_id: string
    total: float

scoring:
  # lo que le importa al negocio pesa más
  weights:
    invoice_number: 1
    date: 1
    supplier:
      name: 1
      tax_id: 0
    total: 5
  aggregator: weighted_mean

data:
  path: ./exam.jsonl
Papers

Lo que publicamos

arXiv:2609.30550
cs.AI · sep 2026

Benchy: towards a universal language for task-oriented AI benchmarks

El lenguaje, el modelo de objetos y el motor de ejecución de benchy.

F. F. Daniel, M. Ibañez, F. Perelman, M. Basti
Leer ↗
arXiv · ID pendiente
posición

On the missing benchmarks layer and a potential solution

La capa de evaluación que le falta a América Latina para desarrollar IA propia. Base de LatamBoard.

F. F. Daniel, M. Ibañez, F. Perelman, M. Basti
arXiv · ID pendiente

Evaluación cultural de LLMs

El gap de Llama-3.1-8B-Instruct se triplica cuando se lo evalúa sobre conocimiento latinoamericano en lugar de anglosajón: de 13,5 a 30,6 puntos.

¿Querés construir con nosotros?

Contanos qué estás investigando o qué te gustaría entrenar.