👁️

Visión por Computadora

Servicios de Azure AI Vision para procesamiento de imágenes y video

⏱️ Tiempo estimado de lectura: 18 minutos

Azure AI Vision (Análisis de Imágenes)

Azure AI Vision proporciona servicios para analizar y extraer información de imágenes y videos.

Capacidades principales:
- Detección de objetos: Identifica y localiza objetos en imágenes.
- Etiquetado de imágenes: Asigna etiquetas descriptivas a imágenes completas.
- Generación de descripciones: Crea descripciones textuales detalladas de imágenes.
- Detección de contenido inapropiado: Identifica contenido para adultos, violento o sensible.
- Análisis de rostros: Detecta emociones, edad aproximada, género.
- Reconocimiento óptico de caracteres (OCR): Extrae texto de imágenes.

Casos de uso:
- Moderación de contenido en redes sociales
- Análisis de imágenes médicas
- Automatización de inventarios
- Mejora de accesibilidad para personas con discapacidad visual

Puntos Clave

  • Detección de objetos identifica y localiza elementos en imágenes
  • Etiquetado automático asigna palabras clave descriptivas
  • Generación de descripciones crea texto explicativo
  • Detección de contenido inapropiado para moderación
  • OCR extrae texto impreso de imágenes
  • Análisis facial detecta emociones y características

Azure AI Face

Azure AI Face es un servicio especializado para el análisis facial con capacidades avanzadas.

Detección Facial:
- Localización precisa de rostros en imágenes
- Detección de accesorios (gafas, máscaras)
- Análisis de desenfoque y calidad de imagen
- Estimación de edad, género y emociones

Reconocimiento/Identificación Facial:
- Verificación facial (1:1): Compara una cara con otra para verificar identidad
- Identificación facial (1:N): Busca una cara en un grupo de personas conocidas
- Detección de similitud facial
- Agrupación de rostros similares

Consideraciones éticas:
- Requiere consentimiento explícito de las personas
- Cumple con regulaciones de privacidad
- Incluye medidas de seguridad para prevenir abuso
- Transparente sobre el uso de datos biométricos

Puntos Clave

  • Detección identifica ubicación y características de rostros
  • Verificación compara dos rostros para confirmar identidad
  • Identificación busca un rostro en una base de datos
  • Requiere consentimiento y cumple con privacidad
  • Detecta emociones, edad y género aproximados
  • Incluye medidas de seguridad contra abuso

Reconocimiento Óptico de Caracteres (OCR)

OCR es la tecnología que convierte imágenes de texto en texto editable y searchable.

Azure AI Vision Read API:
- Extrae texto impreso y manuscrito
- Mantiene el formato y estructura del documento
- Soporta múltiples idiomas y tipos de letra
- Alta precisión en documentos escaneados y fotos

Características avanzadas:
- Detección de layout: Identifica párrafos, tablas, columnas
- Extracción estructurada: Convierte documentos a formatos JSON estructurados
- Procesamiento por lotes: Maneja múltiples páginas simultáneamente
- Corrección automática: Mejora la precisión con modelos de IA

Aplicaciones comunes:
- Digitalización de documentos
- Automatización de entrada de datos
- Análisis de contratos y formularios
- Accesibilidad para personas con discapacidad visual

Puntos Clave

  • Convierte imágenes de texto a texto editable
  • Soporta texto impreso y manuscrito
  • Mantiene formato y estructura del documento
  • Procesamiento por lotes para eficiencia
  • Alta precisión con modelos de IA avanzados
  • Útil para digitalización y automatización

Azure AI Custom Vision (Modelos Personalizados)

A diferencia de Azure AI Vision (que usa modelos pre-entrenados por Microsoft), Custom Vision permite entrenar tus propios modelos de imagen con tus propias fotos.

Dos tareas principales:
1. Clasificación de Imágenes (Image Classification): Predice una etiqueta para toda la imagen.
* *Ejemplo:* ¿Es esta imagen un 'Perro' o un 'Gato'?
2. Detección de Objetos (Object Detection): Encuentra la ubicación (coordenadas/caja delimitadora) de objetos específicos dentro de una imagen.
* *Ejemplo:* ¿Dónde están los cascos de seguridad en esta foto de la obra?

Proceso:
- Subir imágenes propias.
- Etiquetarlas manualmente.
- Entrenar el modelo.
- Evaluar y publicar.

Puntos Clave

  • Entrena modelos con datos propios del usuario
  • Clasificación: Etiqueta la imagen entera
  • Detección de Objetos: Localiza coordenadas de objetos
  • Requiere un proceso de etiquetado y entrenamiento
  • Ideal para casos de uso muy específicos (ej: marcas propias)

Azure AI Video Indexer (Análisis de Video)

Un servicio especializado para extraer información profunda (insights) de archivos de video y audio.

Capacidades Clave:
- Reconocimiento facial en video: Identifica personas y en qué momentos aparecen.
- OCR en video: Lee texto que aparece en pantalla (ej: letreros, presentaciones).
- Transcripción de audio: Convierte el habla en texto y genera subtítulos.
- Detección de temas y sentimientos: Analiza de qué se habla y el tono emocional.
- Identificación de hablantes: Distingue quién está hablando en cada momento.
- Indexación: Hace que el contenido del video sea 'buscable'.

Herramienta: Se suele utilizar a través del portal web de Video Indexer o vía API.

Puntos Clave

  • Extrae metadatos y conocimientos de videos
  • Combina visión (rostros, texto) y audio (voz)
  • Genera transcripciones y subtítulos automáticos
  • Permite buscar dentro del contenido del video
  • Identifica hablantes y temas clave