3BS Technology
Español

Mediciones, no magia

Menos sobrecarga.
Evidencia que puedes inspeccionar.

Medimos la sobrecarga del contexto y de la orquestación en flujos de trabajo delimitados. Estos resultados muestran lo ocurrido en pruebas propias específicas, no son una promesa sobre todos los modelos, tareas o facturas.

La respuesta breve

COSMOS conserva el estado útil entre sesiones, recupera un conjunto de trabajo específico y devuelve evidencia compacta. Las distintas capas ahorran recursos diferentes: los tokens de entrada, los bytes transportados y las llamadas a herramientas deben medirse por separado.

Resultado propio medido

Contexto de entrada

Antes
69.393
Después
4547
Reducción
93,45%

tokens de entrada

Alcance y método

Una prueba canario sintética con salida exacta comparó perfiles mínimos de proveedor heredados y aislados. Ambos devolvieron la respuesta exacta requerida; los estados de caché fueron diferentes. Solo se midieron los tokens de entrada, no el ahorro facturado ni la calidad del trabajo completo.

Lo que esto no demuestra

Los estados de caché fueron diferentes. Esto no aísla la calidad de la recuperación ni establece una facturación equivalente del proveedor.

Evidencia revisada: · Pruebas: 1

Resultado propio medido

Carga útil compacta de resultados

Antes
4290
Después
712
Reducción
83,4%

bytes de resultados

Alcance y método

Diez pruebas de desarrollo locales de cinco comparaciones de archivos compararon resultados que ya eran compactos con un procedimiento por lotes. Los resultados correctos serializados ocuparon 4,290 y 712 bytes por prueba. Los resultados de igualdad sobre la misma instantánea coincidieron; se excluyeron la configuración, los fallos y la construcción del procedimiento.

Lo que esto no demuestra

Los bytes de resultados no representan todo el tráfico transmitido ni los tokens del modelo. Los resultados de octubre corresponden a un candidato de desarrollo local, no constituyen una afirmación sobre una versión publicada.

Evidencia revisada: · Pruebas: 10

Resultado propio medido

Tráfico de diagnóstico firmado

Antes
121.896
Después
82.455
Reducción
32,36%

bytes transmitidos

Alcance y método

Diez escenarios neutrales de diagnóstico locales midieron en conjunto 121,896 y 82,455 bytes reales de respuesta transmitidos. Cuatro escenarios necesitaron más bytes y una llamada adicional. Se excluyó la configuración compartida; no se comparó la calidad de la respuesta final del modelo.

Lo que esto no demuestra

Los bytes transferidos por la red no permiten determinar el uso de tokens del modelo ni los costes reales. Los resultados de octubre son candidatos del desarrollo local, no una afirmación de lanzamiento.

Evidencia revisada: · Pruebas: 10

Resultado propio medido

Llamadas de diagnóstico

Antes
59
Después
49
Reducción
16,95%

llamadas a herramientas

Alcance y método

Los mismos diez escenarios de diagnóstico locales midieron en conjunto 59 y 49 llamadas a herramientas. El total disminuyó, pero no todos los escenarios individuales mejoraron.

Lo que esto no demuestra

Un menor número de llamadas no demuestra por sí solo una latencia menor, un coste inferior ni un rendimiento equivalente en otras tareas.

Evidencia revisada: · Pruebas: 10

Nuestro compromiso con la medición

Para un piloto, acordamos una referencia, tareas representativas, comprobaciones de calidad y criterios de éxito antes de comparar los resultados. Informamos de los supuestos sobre la caché, la salida, los reintentos y el uso de herramientas; no convertimos una única prueba canario en una afirmación universal.

Flujos de trabajo reales, claramente delimitados

Estos son ejemplos propios de desarrollo y operaciones. No son recomendaciones independientes de clientes, y un ejemplo operativo no es automáticamente un caso medido de ahorro de tokens.

Patrón operativo

Evidencia del marketplace → verificación contable

COSMOS mantiene los registros de origen dentro del límite de confianza, prepara un candidato, ejecuta comprobaciones de paridad y verifica las acciones contables aprobadas volviendo a leer el estado externo. La conclusión es una ejecución controlada y una menor repetición de la investigación; no se afirma ningún porcentaje de ahorro de tokens para este flujo de trabajo.

Patrón de desarrollo

Traspasos de desarrollo específicos

Un especialista recibe los archivos, las restricciones y las comprobaciones pertinentes en lugar de todo el historial de la conversación. Los resultados estructurados regresan a una única tarea revisable. La reducción del contexto se evalúa para cada tarea, con pruebas que protegen el resultado requerido.

Flujo de trabajo ilustrativo

Investigación → traducción → revisión

La investigación, la redacción, la traducción y la revisión editorial utilizan funciones específicas y referencias a las fuentes. La publicación sigue siendo una acción independiente que requiere aprobación. El ahorro depende del volumen de las fuentes, los traspasos y los proveedores seleccionados.

MCP / API / IDE

Tu entorno. Un plano de control compartido.

Conecta las herramientas que ya utilizas mediante MCP y adaptadores de proveedores configurados. La compatibilidad con el protocolo no equivale a una integración nativa verificada de extremo a extremo.

Adopción local o adaptador configurado; se requiere aceptación

Adopción local y hosts configurados

  • VS Code
  • Native Codex
  • Cursor
  • Claude / Claude Code

VS Code y Codex nativo cuentan con vías de adopción local registradas. Cursor y Claude / Claude Code nativos disponen de adaptadores de configuración de entorno de pruebas y MCP; un adaptador configurado no implica la aceptación del host. Cada chat nuevo del host, versión, conjunto de permisos y carga de trabajo se verifica por separado.

Compatible con el protocolo o candidato; se requiere validación en un piloto

Hosts y candidatos compatibles con MCP

  • MCP-compatible hosts
  • OpenClaw

Otros entornos compatibles con MCP pueden utilizar la interfaz MCP gobernada, sujetos al transporte, los permisos y la admisión de herramientas. OpenClaw es un candidato para un piloto de integración externa con alcance definido, no una integración incluida y verificada; su puerta de enlace y su entorno de ejecución no están integrados.

Evidencia sintética, contratos de adaptadores y enrutamiento previsto

Proveedores y canales personalizados

  • Z.AI / GLM
  • OpenRouter
  • Python / CLI / MCP pipelines

Z.AI / GLM superó una prueba canario sintética con salida exacta; esto no autoriza el enrutamiento de datos privados ni establece la calidad general del modelo. El enrutamiento y la evaluación mediante OpenRouter están previstos, pero los perfiles cerrados de proveedores no los admiten actualmente. Los canales personalizados pueden utilizar contratos de Python, CLI y MCP en torno a adaptadores de dominio validados individualmente.

Despliega en torno a tus límites

Hablamos sobre el despliegue local, en servidores privados y gestionado en función de tus datos y restricciones operativas. Una demostración con alcance definido establece el IDE, el modelo, las herramientas, los permisos y la evidencia requeridos antes de un despliegue general.

La reproducibilidad pública es el siguiente paso

Está pendiente un repositorio público de GitHub con un corpus de pruebas de rendimiento depurado e instrucciones de reproducción. Todavía no se ha publicado. Actualmente podemos hablar sobre el método de medición y acordar un piloto repetible; no se presenta ningún enlace roto a un repositorio.

UN PRIMER PASO MÁS PEQUEÑO

Empieza con un flujo de trabajo.
Define qué significa «terminado».

La conversación sobre un piloto empieza por el trabajo, no por una migración de plataforma. Acuerda el alcance, los límites de acceso y una prueba útil antes de decidir qué construir.

01

Trazar los traspasos

Identifica las fuentes, las funciones de los agentes y las decisiones que requieren una persona.

02

Definir la prueba

Elige una referencia, comprobaciones de aceptación y los límites del resultado.

03

Revisar el siguiente paso

Utiliza la evidencia para decidir si perfeccionar, ampliar o detener el trabajo.

Un primer candidato útil

Una tarea recurrente con evidencia accesible y un resultado que puedas inspeccionar. Mantén el primer alcance lo bastante reducido como para poder revisarlo.

Deja fuera del primer alcance

El acceso sin restricciones, las acciones irreversibles sin supervisión o la promesa de que todas las respuestas de los modelos serán correctas.

Prepara una consulta breve

Elige un punto de partida y describe un resultado. Copia las instrucciones cuando estén listas; tú decides qué compartir.

Este creador funciona únicamente en esta página. No se almacena, analiza ni envía nada automáticamente. No introduzcas contraseñas ni información confidencial.

Abrir Telegram

No se envía nada automáticamente.

Qué significan estas cifras

¿Garantizará COSMOS el mismo ahorro para mi equipo?

No. Medimos la carga de trabajo real y comprobamos el resultado requerido. El contexto, la caché, los precios de los modelos, las herramientas y los reintentos pueden cambiar el resultado.

¿Puedo utilizar mi IDE y mis modelos actuales?

COSMOS admite vías nativas de proveedores, entornos compatibles con MCP y adaptadores configurados. El host, el modelo, los permisos y el despliegue concretos se validan para tu flujo de trabajo.

¿Dónde está el repositorio público de pruebas de rendimiento?

La publicación en GitHub está pendiente. En esta página no se afirma que exista un repositorio público ni una reproducción independiente.

Mide tu flujo de trabajo con nosotros.

Trae una tarea, una referencia y el resultado que debe seguir siendo correcto. Podemos mostrar el flujo de trabajo, hablar sobre tu conjunto tecnológico y definir una demostración o un piloto delimitados.

Hablar por Telegram