👁️

Visión por Computadora

Servicios de AWS para análisis de imágenes y video

⏱️ Tiempo estimado de lectura: 18 minutos

Amazon Rekognition

Servicio de análisis de imágenes y videos basado en deep learning que no requiere experiencia en ML.

Características Principales



Detección de Objetos y Escenas


- Identifica miles de objetos (vehículos, mascotas, muebles)
- Reconoce actividades (corriendo, bailando)
- Detecta escenas (playa, ciudad, atardecer)

Reconocimiento Facial


- Detección de rostros: Ubicación y atributos
- Comparación de rostros: Similitud entre dos caras
- Búsqueda facial: Buscar personas en colecciones
- Análisis facial: Edad estimada, género, emociones

Reconocimiento de Celebridades


- Identifica celebridades en imágenes y videos
- Proporciona información adicional

Moderación de Contenido


- Detecta contenido inapropiado o ofensivo
- Clasifica por categorías (violencia, drogas, etc.)
- Niveles de confianza ajustables

Detección de Texto (OCR)


- Extrae texto de imágenes
- Soporta texto impreso y manuscrito
- Múltiples idiomas

Detección de PPE


- Equipo de Protección Personal
- Cascos, guantes, mascarillas
- Útil para cumplimiento de seguridad

Casos de Uso


- Verificación de identidad
- Seguridad y vigilancia
- Moderación de contenido en redes sociales
- Análisis de medios
- Control de acceso
- Búsqueda visual

Puntos Clave

  • Rekognition ofrece funcionalidades listas para producción sin modelos custom
  • Validar precisión por grupos demográficos para evitar sesgos en reconocimiento facial
  • Optimizar imágenes (resolución, formato) para mejorar OCR y detección
  • Considerar costes de procesamiento de video vs imagen estática
  • Combinar servicios (Rekognition + Textract) para pipelines heterogéneos

Amazon Textract

Servicio que extrae automáticamente texto, escritura a mano y datos de documentos escaneados.

Capacidades



Extracción de Texto


- OCR avanzado
- Texto impreso y manuscrito
- Preserva el diseño del documento

Análisis de Formularios


- Identifica pares clave-valor
- Extrae datos de campos de formularios
- Casillas de verificación

Análisis de Tablas


- Extrae datos tabulares
- Mantiene estructura de filas y columnas
- Procesa tablas complejas

Análisis de Documentos de Identidad


- Pasaportes
- Licencias de conducir
- Extrae información estructurada

Detección de Firmas


- Identifica firmas en documentos
- Útil para validación

Queries (Consultas)


- Busca información específica en documentos
- Preguntas en lenguaje natural
- Ejemplo: '¿Cuál es el monto total?'

Ventajas sobre OCR Tradicional


- Comprende estructura del documento
- No requiere configuración manual
- Maneja múltiples formatos
- Alta precisión

Casos de Uso


- Procesamiento de facturas
- Automatización de préstamos hipotecarios
- Extracción de registros médicos
- Digitalización de documentos legales
- Procesamiento de reclamaciones de seguros
- Onboarding de clientes (KYC)

Puntos Clave

  • Textract es ideal para extraer estructura de documentos; siempre validar tablas y formularios complejos
  • Preprocesar imágenes (deskew, mejora contraste) mejora OCR
  • Probar con documentos reales y variantes (idiomas, formatos)
  • Usar Queries para extraer campos específicos en grandes volúmenes
  • Controlar PII y aplicar redacción cuando sea necesario

Otros Servicios de Visión

Amazon Lookout for Vision



Propósito: Detectar defectos en productos manufacturados

Características:
- Inspección visual automatizada
- Identifica anomalías y defectos
- Entrenamiento con pocas imágenes (30+)
- Integración con líneas de producción

Casos de uso:
- Control de calidad en manufactura
- Detección de productos dañados
- Verificación de ensamblaje

Amazon Monitron



Propósito: Monitoreo predictivo de equipos industriales

Características:
- Sistema end-to-end de mantenimiento predictivo
- Sensores para vibración y temperatura
- Detecta comportamiento anormal en maquinaria
- ML automático sin necesidad de desarrollo

AWS Panorama



Propósito: Análisis de visión por computadora en el edge

Características:
- Dispositivo físico (Panorama Appliance)
- Procesa video de cámaras IP localmente
- Baja latencia
- Privacidad (datos no salen del sitio)

Casos de uso:
- Verificación de PPE en tiempo real
- Conteo de personas
- Control de calidad en manufactura
- Análisis de tráfico en retail

Amazon Rekognition Video



Análisis de Video:
- Detección de actividades
- Seguimiento de personas
- Reconocimiento facial en tiempo real
- Detección de contenido inapropiado
- Análisis de eventos deportivos

Puntos Clave

  • Lookout for Vision es útil para inspección industrial con pocas muestras de entrenamiento
  • Monitron y Panorama cubren escenarios de edge y mantenimiento predictivo
  • Evaluar sensibilidad del caso de uso y latencia para elegir edge vs cloud
  • Integrar pipelines de inferencia con alertas y sistemas de acción
  • Medir falsos positivos/negativos en producción y ajustar umbrales