# Digercules

Digercules es un programa con componentes de redes neuronales que toma cualquier montón desordenado de ficheros — un archivo, una biblioteca, grabaciones de conciertos, correspondencia de mensajería — y lo convierte en una biblioteca estructurada, incluyendo deduplicación inteligente: encontrar todas las copias de lo mismo, eliminar lo sobrante y no perder nada importante. Por cada archivo — un tema, un idioma, un tipo de documento, entidades clave, un resumen breve. Esto se hace de antemano, sin prisas ni plazos, antes de que a nadie le urja — no en el último momento bajo presión por una tarea concreta. La biblioteca terminada puede alimentar a cualquier red neuronal, base de datos o sistema de búsqueda — a partir de ahí ellos mismos encuentran lo necesario y construyen la interfaz; Digercules no reemplaza ese siguiente paso, lo hace posible desde el principio, asumiendo esa preparación laboriosa para la que nunca hay recursos suficientes.

Los datos se procesan sin nubes corporativas — o bien enteramente en el propio equipo del cliente (si cuenta con la GPU necesaria), o bien al autor del programa no se le envían los archivos originales, sino copias comprimidas preparadas específicamente para el reconocimiento, y solo vuelve texto.

Ya comprobado en archivos de diversa escala — estadísticas reales de proyectos procesados:

<div class="stat-grid">
  <div class="stat-tile"><div class="stat-value">800.000+</div><div class="stat-label">archivos procesados</div></div>
  <div class="stat-tile"><div class="stat-value">~85 TB</div><div class="stat-label">volumen de origen</div></div>
  <div class="stat-tile"><div class="stat-value">66.000+ h</div><div class="stat-label">de audio (~7,5 años)</div></div>
  <div class="stat-tile"><div class="stat-value">1,8 TB</div><div class="stat-label">liberado por deduplicación</div></div>
  <div class="stat-tile"><div class="stat-value">3.507 h</div><div class="stat-label">dedicadas al procesamiento</div></div>
  <div class="stat-tile"><div class="stat-value">~430</div><div class="stat-label">intérpretes identificados en vídeo</div></div>
</div>

Por el canal disponible (~30 Mbit/s, medido) subir este volumen a la nube tardaría unos 262 días — frente a los 96 que realmente llevó procesarlo en el sitio. El almacenamiento costaría desde $84/mes, y el procesamiento en una GPU comparable costaría desde $150–190/mes. Y eso sin contar el siguiente paso: los datos igualmente hay que moverlos del almacenamiento a la propia máquina con GPU para procesarlos — incluso por una conexión tres veces más rápida (100 Mbit/s), un lote de varios terabytes tarda unos 3 días.

## Lo que realmente funciona por dentro

Digercules no es un solo modelo — es un proceso orquestado de más de 25 fases, cada una resolviendo una tarea concreta, donde el resultado de una alimenta a la siguiente.

**Voz a texto.** El audio y el vídeo pasan por `faster-whisper` (large-v3-turbo): primero una pasada rápida para cotejar y priorizar, luego una pasada principal, más lenta y cuidadosa, con indicaciones guiadas construidas a partir del propio vocabulario del archivo. Cuando un archivo tiene su propio elenco recurrente de voces o su propia terminología particular, el modelo puede ajustarse (LoRA) específicamente a ese corpus — comprobado sobre cientos de horas de una misma colección.

**Identificación de voz.** Un modelo de embeddings de voz (ECAPA-TDNN) construye una galería de voces: quién habla, comparado con todo lo que el sistema ya ha escuchado antes — la galería crece con cada archivo procesado.

**Identificación de rostros.** La misma lógica que la identificación de voz, aplicada a rostros: una galería con varios prototipos por persona — capaz de algo que un único rostro promediado no puede: reconocer a la misma persona fotografiada de niño y cuarenta años después. La pantalla de confirmación se ha probado sobre 20 TB de grabaciones reales de conciertos.

<figure class="screenshot">
  <img src="/assets/img/screenshots/face-review-cluster.jpg" alt="Pantalla de revisión de rostros: galería de variantes confirmadas para una persona" loading="lazy">
  <figcaption>Pantalla de revisión: todas las apariciones confirmadas del rostro de una persona, agrupadas por vídeo.</figcaption>
</figure>

<figure class="screenshot">
  <img src="/assets/img/screenshots/face-review-suggestions.jpg" alt="Pantalla de revisión de rostros: coincidencias sugeridas con porcentaje de similitud" loading="lazy">
  <figcaption>La misma pantalla durante la revisión: el sistema sugiere una coincidencia con un porcentaje de similitud, y una persona la confirma o la rechaza.</figcaption>
</figure>

La decisión es siempre de la persona: la similitud es una pista con un porcentaje, no una respuesta terminada, y no existe un umbral seguro a partir del cual se pueda confiar en ella automáticamente — la interfaz no lo oculta. Un rostro que nadie reconoce no se hace pasar por identificado; espera a quien conoce mejor el archivo. [Más sobre cómo funciona el módulo](https://digercules.com/es/face-identification/).

**OCR.** Los documentos escaneados pasan por Marker — un motor de reconocimiento y conversión de PDF/escaneos de código abierto — convirtiendo una página fotografiada en texto buscable, no solo en una imagen con letras.

**Comprensión de fotografías, por niveles.** Cada banco de fotos pasa primero por una pasada barata, solo CPU (OpenCV DNN — EAST para regiones de texto, YuNet para conteo de rostros), que funciona igual en cualquier máquina de la flota, incluido hardware con Windows 7 de una década de antigüedad. En hardware más reciente, una segunda pasada añade clasificación de escena CLIP zero-shot a velocidad de GPU. Donde de verdad importa, un modelo visión-lenguaje completo (Ollama) escribe una descripción real de cada foto. Tres niveles, el más barato primero.

**Comprensión de documentos.** Cada archivo se lee y se describe mediante un LLM local (Ollama): de qué trata, en qué idioma, para qué sirve realmente.

**Deduplicación que además protege tus archivos.** El mismo hash que encuentra copias duplicadas también verifica, byte a byte, que un archivo que vuelve a tu archivo tras el procesamiento es exactamente el mismo que salió de él.

<figure class="screenshot">
  <img src="/assets/img/screenshots/face-review-scale.jpg" alt="Muro denso de cientos de variantes de rostros reconocidos en un archivo" loading="lazy">
  <figcaption>Escala real, en un solo archivo: cientos de variantes de rostros reconocidos, agrupadas automáticamente y afinadas por una persona.</figcaption>
</figure>

Cada una de estas fases se ejecuta localmente o en una máquina concreta, nombrada, que tú eliges — nunca en una nube anónima.

## Estado

El producto está en desarrollo activo. La biblioteca de ingeniería está estable, en producción.

## Geografía del equipo

El desarrollo lo realiza un equipo distribuido en varios países: Israel, Georgia, Rusia. Puntos reales de presencia de la infraestructura de cómputo: Rishon LeZion, Israel · Tbilisi, Georgia · Cheliábinsk, Rusia · Moscú, Rusia.

## A dónde ir después

Digercules atiende a distintos tipos de clientes a través de sitios independientes:

- **[digercules.ru](https://digercules.ru/)** — consumidores rusos, archivo de actuaciones en vivo (canción de autor y más)
- **[digercules.org](https://digercules.org/es/)** — propuestas para organizaciones
- **[digercules.net](https://digercules.net/es/)** — clientes particulares, casos de uso concretos

## Cómo se paga esto

Una pasada local y autónoma es una compra única de la herramienta sin límite de volumen de archivo; solo la valoración preliminar, a partir de una descripción o captura del archivo, es gratuita. La coordinación más pesada, cuando la capacidad propia no basta, va aparte y se fija según el volumen de trabajo realmente encontrado — hoy no hay una cifra fija para eso. Como referencia de mercado, vea las cifras más arriba en esta página (lo que costaría una tarea comparable a través de una nube corriente). Los detalles de cada escenario están en [digercules.org](https://digercules.org/es/) y [digercules.net](https://digercules.net/es/).
