Voz e imágenes: cómo el bot entiende multimedia
Los clientes no siempre escriben texto. Muchas veces mandan notas de voz porque les da flojera escribir, o fotos de productos, recetas médicas, comprobantes de pago, propiedades que quieren consultar. iAnswer integra Gemini de Google para procesar esos contenidos y que el bot responda de forma coherente.
Activar el procesamiento de voz
Si tu plan incluye el feature ai_voice_notes:
Ve a Agente IA → Capacidades → Voz.
Activa el toggle.
Define el idioma esperado (por default español de México, pero puedes elegir español neutro o inglés).
Decide qué hace el bot con la voz: transcribir y mostrar en el Inbox (para que tengas registro escrito) y/o responder al contenido directamente.
Una nota de voz típica de 30 segundos se procesa en 3-5 segundos. El cliente no nota la espera porque el bot ya está pensando la respuesta mientras transcribe.
Activar el procesamiento de imágenes
Con ai_image_analysis activo:
Ve a Agente IA → Capacidades → Imágenes.
Define qué tipos de imagen son relevantes para tu negocio:
Salud: recetas, estudios de laboratorio, ubicaciones, identificaciones.
Bienes Raíces: fotos de propiedades que el cliente quiere referenciar, comprobantes de depósito, identificaciones.
Restaurantes: fotos del lugar, capturas de menú externo, screenshots de redes sociales.
Qué SÍ y qué NO puede hacer
El sistema puede:
Describir el contenido de una imagen ("es la foto de un edificio de 5 pisos").
Extraer texto de una imagen (OCR de tickets, recetas, etc.).
Reconocer objetos comunes.
El sistema NO debe usarse para:
Diagnosticar condiciones médicas a partir de fotos.
Autenticar identidades oficiales.
Reconocer rostros de personas específicas.
Tomar decisiones de aprobación de crédito basadas en documentos.
Estos usos están bloqueados a nivel de plataforma porque tienen implicaciones legales y de seguridad.
¿Te resultó útil este artículo?