👁️
Visión por Computadora
Servicios de Azure AI Vision para procesamiento de imágenes y video
⏱️ Tiempo estimado de lectura: 18 minutos
Azure AI Vision (Análisis de Imágenes)
Azure AI Vision proporciona servicios para analizar y extraer información de imágenes y videos.
Capacidades principales:
- Detección de objetos: Identifica y localiza objetos en imágenes.
- Etiquetado de imágenes: Asigna etiquetas descriptivas a imágenes completas.
- Generación de descripciones: Crea descripciones textuales detalladas de imágenes.
- Detección de contenido inapropiado: Identifica contenido para adultos, violento o sensible.
- Análisis de rostros: Detecta emociones, edad aproximada, género.
- Reconocimiento óptico de caracteres (OCR): Extrae texto de imágenes.
Casos de uso:
- Moderación de contenido en redes sociales
- Análisis de imágenes médicas
- Automatización de inventarios
- Mejora de accesibilidad para personas con discapacidad visual
Capacidades principales:
- Detección de objetos: Identifica y localiza objetos en imágenes.
- Etiquetado de imágenes: Asigna etiquetas descriptivas a imágenes completas.
- Generación de descripciones: Crea descripciones textuales detalladas de imágenes.
- Detección de contenido inapropiado: Identifica contenido para adultos, violento o sensible.
- Análisis de rostros: Detecta emociones, edad aproximada, género.
- Reconocimiento óptico de caracteres (OCR): Extrae texto de imágenes.
Casos de uso:
- Moderación de contenido en redes sociales
- Análisis de imágenes médicas
- Automatización de inventarios
- Mejora de accesibilidad para personas con discapacidad visual
Puntos Clave
- ✓ Detección de objetos identifica y localiza elementos en imágenes
- ✓ Etiquetado automático asigna palabras clave descriptivas
- ✓ Generación de descripciones crea texto explicativo
- ✓ Detección de contenido inapropiado para moderación
- ✓ OCR extrae texto impreso de imágenes
- ✓ Análisis facial detecta emociones y características
Azure AI Face
Azure AI Face es un servicio especializado para el análisis facial con capacidades avanzadas.
Detección Facial:
- Localización precisa de rostros en imágenes
- Detección de accesorios (gafas, máscaras)
- Análisis de desenfoque y calidad de imagen
- Estimación de edad, género y emociones
Reconocimiento/Identificación Facial:
- Verificación facial (1:1): Compara una cara con otra para verificar identidad
- Identificación facial (1:N): Busca una cara en un grupo de personas conocidas
- Detección de similitud facial
- Agrupación de rostros similares
Consideraciones éticas:
- Requiere consentimiento explícito de las personas
- Cumple con regulaciones de privacidad
- Incluye medidas de seguridad para prevenir abuso
- Transparente sobre el uso de datos biométricos
Detección Facial:
- Localización precisa de rostros en imágenes
- Detección de accesorios (gafas, máscaras)
- Análisis de desenfoque y calidad de imagen
- Estimación de edad, género y emociones
Reconocimiento/Identificación Facial:
- Verificación facial (1:1): Compara una cara con otra para verificar identidad
- Identificación facial (1:N): Busca una cara en un grupo de personas conocidas
- Detección de similitud facial
- Agrupación de rostros similares
Consideraciones éticas:
- Requiere consentimiento explícito de las personas
- Cumple con regulaciones de privacidad
- Incluye medidas de seguridad para prevenir abuso
- Transparente sobre el uso de datos biométricos
Puntos Clave
- ✓ Detección identifica ubicación y características de rostros
- ✓ Verificación compara dos rostros para confirmar identidad
- ✓ Identificación busca un rostro en una base de datos
- ✓ Requiere consentimiento y cumple con privacidad
- ✓ Detecta emociones, edad y género aproximados
- ✓ Incluye medidas de seguridad contra abuso
Reconocimiento Óptico de Caracteres (OCR)
OCR es la tecnología que convierte imágenes de texto en texto editable y searchable.
Azure AI Vision Read API:
- Extrae texto impreso y manuscrito
- Mantiene el formato y estructura del documento
- Soporta múltiples idiomas y tipos de letra
- Alta precisión en documentos escaneados y fotos
Características avanzadas:
- Detección de layout: Identifica párrafos, tablas, columnas
- Extracción estructurada: Convierte documentos a formatos JSON estructurados
- Procesamiento por lotes: Maneja múltiples páginas simultáneamente
- Corrección automática: Mejora la precisión con modelos de IA
Aplicaciones comunes:
- Digitalización de documentos
- Automatización de entrada de datos
- Análisis de contratos y formularios
- Accesibilidad para personas con discapacidad visual
Azure AI Vision Read API:
- Extrae texto impreso y manuscrito
- Mantiene el formato y estructura del documento
- Soporta múltiples idiomas y tipos de letra
- Alta precisión en documentos escaneados y fotos
Características avanzadas:
- Detección de layout: Identifica párrafos, tablas, columnas
- Extracción estructurada: Convierte documentos a formatos JSON estructurados
- Procesamiento por lotes: Maneja múltiples páginas simultáneamente
- Corrección automática: Mejora la precisión con modelos de IA
Aplicaciones comunes:
- Digitalización de documentos
- Automatización de entrada de datos
- Análisis de contratos y formularios
- Accesibilidad para personas con discapacidad visual
Puntos Clave
- ✓ Convierte imágenes de texto a texto editable
- ✓ Soporta texto impreso y manuscrito
- ✓ Mantiene formato y estructura del documento
- ✓ Procesamiento por lotes para eficiencia
- ✓ Alta precisión con modelos de IA avanzados
- ✓ Útil para digitalización y automatización
Azure AI Custom Vision (Modelos Personalizados)
A diferencia de Azure AI Vision (que usa modelos pre-entrenados por Microsoft), Custom Vision permite entrenar tus propios modelos de imagen con tus propias fotos.
Dos tareas principales:
1. Clasificación de Imágenes (Image Classification): Predice una etiqueta para toda la imagen.
* *Ejemplo:* ¿Es esta imagen un 'Perro' o un 'Gato'?
2. Detección de Objetos (Object Detection): Encuentra la ubicación (coordenadas/caja delimitadora) de objetos específicos dentro de una imagen.
* *Ejemplo:* ¿Dónde están los cascos de seguridad en esta foto de la obra?
Proceso:
- Subir imágenes propias.
- Etiquetarlas manualmente.
- Entrenar el modelo.
- Evaluar y publicar.
Dos tareas principales:
1. Clasificación de Imágenes (Image Classification): Predice una etiqueta para toda la imagen.
* *Ejemplo:* ¿Es esta imagen un 'Perro' o un 'Gato'?
2. Detección de Objetos (Object Detection): Encuentra la ubicación (coordenadas/caja delimitadora) de objetos específicos dentro de una imagen.
* *Ejemplo:* ¿Dónde están los cascos de seguridad en esta foto de la obra?
Proceso:
- Subir imágenes propias.
- Etiquetarlas manualmente.
- Entrenar el modelo.
- Evaluar y publicar.
Puntos Clave
- ✓ Entrena modelos con datos propios del usuario
- ✓ Clasificación: Etiqueta la imagen entera
- ✓ Detección de Objetos: Localiza coordenadas de objetos
- ✓ Requiere un proceso de etiquetado y entrenamiento
- ✓ Ideal para casos de uso muy específicos (ej: marcas propias)
Azure AI Video Indexer (Análisis de Video)
Un servicio especializado para extraer información profunda (insights) de archivos de video y audio.
Capacidades Clave:
- Reconocimiento facial en video: Identifica personas y en qué momentos aparecen.
- OCR en video: Lee texto que aparece en pantalla (ej: letreros, presentaciones).
- Transcripción de audio: Convierte el habla en texto y genera subtítulos.
- Detección de temas y sentimientos: Analiza de qué se habla y el tono emocional.
- Identificación de hablantes: Distingue quién está hablando en cada momento.
- Indexación: Hace que el contenido del video sea 'buscable'.
Herramienta: Se suele utilizar a través del portal web de Video Indexer o vía API.
Capacidades Clave:
- Reconocimiento facial en video: Identifica personas y en qué momentos aparecen.
- OCR en video: Lee texto que aparece en pantalla (ej: letreros, presentaciones).
- Transcripción de audio: Convierte el habla en texto y genera subtítulos.
- Detección de temas y sentimientos: Analiza de qué se habla y el tono emocional.
- Identificación de hablantes: Distingue quién está hablando en cada momento.
- Indexación: Hace que el contenido del video sea 'buscable'.
Herramienta: Se suele utilizar a través del portal web de Video Indexer o vía API.
Puntos Clave
- ✓ Extrae metadatos y conocimientos de videos
- ✓ Combina visión (rostros, texto) y audio (voz)
- ✓ Genera transcripciones y subtítulos automáticos
- ✓ Permite buscar dentro del contenido del video
- ✓ Identifica hablantes y temas clave