👁️
Visión por Computadora
Servicios de AWS para análisis de imágenes y video
⏱️ Tiempo estimado de lectura: 18 minutos
Amazon Rekognition
Servicio de análisis de imágenes y videos basado en deep learning que no requiere experiencia en ML.
- Identifica miles de objetos (vehículos, mascotas, muebles)
- Reconoce actividades (corriendo, bailando)
- Detecta escenas (playa, ciudad, atardecer)
- Detección de rostros: Ubicación y atributos
- Comparación de rostros: Similitud entre dos caras
- Búsqueda facial: Buscar personas en colecciones
- Análisis facial: Edad estimada, género, emociones
- Identifica celebridades en imágenes y videos
- Proporciona información adicional
- Detecta contenido inapropiado o ofensivo
- Clasifica por categorías (violencia, drogas, etc.)
- Niveles de confianza ajustables
- Extrae texto de imágenes
- Soporta texto impreso y manuscrito
- Múltiples idiomas
- Equipo de Protección Personal
- Cascos, guantes, mascarillas
- Útil para cumplimiento de seguridad
- Verificación de identidad
- Seguridad y vigilancia
- Moderación de contenido en redes sociales
- Análisis de medios
- Control de acceso
- Búsqueda visual
Características Principales
Detección de Objetos y Escenas
- Identifica miles de objetos (vehículos, mascotas, muebles)
- Reconoce actividades (corriendo, bailando)
- Detecta escenas (playa, ciudad, atardecer)
Reconocimiento Facial
- Detección de rostros: Ubicación y atributos
- Comparación de rostros: Similitud entre dos caras
- Búsqueda facial: Buscar personas en colecciones
- Análisis facial: Edad estimada, género, emociones
Reconocimiento de Celebridades
- Identifica celebridades en imágenes y videos
- Proporciona información adicional
Moderación de Contenido
- Detecta contenido inapropiado o ofensivo
- Clasifica por categorías (violencia, drogas, etc.)
- Niveles de confianza ajustables
Detección de Texto (OCR)
- Extrae texto de imágenes
- Soporta texto impreso y manuscrito
- Múltiples idiomas
Detección de PPE
- Equipo de Protección Personal
- Cascos, guantes, mascarillas
- Útil para cumplimiento de seguridad
Casos de Uso
- Verificación de identidad
- Seguridad y vigilancia
- Moderación de contenido en redes sociales
- Análisis de medios
- Control de acceso
- Búsqueda visual
Puntos Clave
- ✓ Rekognition ofrece funcionalidades listas para producción sin modelos custom
- ✓ Validar precisión por grupos demográficos para evitar sesgos en reconocimiento facial
- ✓ Optimizar imágenes (resolución, formato) para mejorar OCR y detección
- ✓ Considerar costes de procesamiento de video vs imagen estática
- ✓ Combinar servicios (Rekognition + Textract) para pipelines heterogéneos
Amazon Textract
Servicio que extrae automáticamente texto, escritura a mano y datos de documentos escaneados.
- OCR avanzado
- Texto impreso y manuscrito
- Preserva el diseño del documento
- Identifica pares clave-valor
- Extrae datos de campos de formularios
- Casillas de verificación
- Extrae datos tabulares
- Mantiene estructura de filas y columnas
- Procesa tablas complejas
- Pasaportes
- Licencias de conducir
- Extrae información estructurada
- Identifica firmas en documentos
- Útil para validación
- Busca información específica en documentos
- Preguntas en lenguaje natural
- Ejemplo: '¿Cuál es el monto total?'
- Comprende estructura del documento
- No requiere configuración manual
- Maneja múltiples formatos
- Alta precisión
- Procesamiento de facturas
- Automatización de préstamos hipotecarios
- Extracción de registros médicos
- Digitalización de documentos legales
- Procesamiento de reclamaciones de seguros
- Onboarding de clientes (KYC)
Capacidades
Extracción de Texto
- OCR avanzado
- Texto impreso y manuscrito
- Preserva el diseño del documento
Análisis de Formularios
- Identifica pares clave-valor
- Extrae datos de campos de formularios
- Casillas de verificación
Análisis de Tablas
- Extrae datos tabulares
- Mantiene estructura de filas y columnas
- Procesa tablas complejas
Análisis de Documentos de Identidad
- Pasaportes
- Licencias de conducir
- Extrae información estructurada
Detección de Firmas
- Identifica firmas en documentos
- Útil para validación
Queries (Consultas)
- Busca información específica en documentos
- Preguntas en lenguaje natural
- Ejemplo: '¿Cuál es el monto total?'
Ventajas sobre OCR Tradicional
- Comprende estructura del documento
- No requiere configuración manual
- Maneja múltiples formatos
- Alta precisión
Casos de Uso
- Procesamiento de facturas
- Automatización de préstamos hipotecarios
- Extracción de registros médicos
- Digitalización de documentos legales
- Procesamiento de reclamaciones de seguros
- Onboarding de clientes (KYC)
Puntos Clave
- ✓ Textract es ideal para extraer estructura de documentos; siempre validar tablas y formularios complejos
- ✓ Preprocesar imágenes (deskew, mejora contraste) mejora OCR
- ✓ Probar con documentos reales y variantes (idiomas, formatos)
- ✓ Usar Queries para extraer campos específicos en grandes volúmenes
- ✓ Controlar PII y aplicar redacción cuando sea necesario
Otros Servicios de Visión
Amazon Lookout for Vision
Propósito: Detectar defectos en productos manufacturados
Características:
- Inspección visual automatizada
- Identifica anomalías y defectos
- Entrenamiento con pocas imágenes (30+)
- Integración con líneas de producción
Casos de uso:
- Control de calidad en manufactura
- Detección de productos dañados
- Verificación de ensamblaje
Amazon Monitron
Propósito: Monitoreo predictivo de equipos industriales
Características:
- Sistema end-to-end de mantenimiento predictivo
- Sensores para vibración y temperatura
- Detecta comportamiento anormal en maquinaria
- ML automático sin necesidad de desarrollo
AWS Panorama
Propósito: Análisis de visión por computadora en el edge
Características:
- Dispositivo físico (Panorama Appliance)
- Procesa video de cámaras IP localmente
- Baja latencia
- Privacidad (datos no salen del sitio)
Casos de uso:
- Verificación de PPE en tiempo real
- Conteo de personas
- Control de calidad en manufactura
- Análisis de tráfico en retail
Amazon Rekognition Video
Análisis de Video:
- Detección de actividades
- Seguimiento de personas
- Reconocimiento facial en tiempo real
- Detección de contenido inapropiado
- Análisis de eventos deportivos
Puntos Clave
- ✓ Lookout for Vision es útil para inspección industrial con pocas muestras de entrenamiento
- ✓ Monitron y Panorama cubren escenarios de edge y mantenimiento predictivo
- ✓ Evaluar sensibilidad del caso de uso y latencia para elegir edge vs cloud
- ✓ Integrar pipelines de inferencia con alertas y sistemas de acción
- ✓ Medir falsos positivos/negativos en producción y ajustar umbrales