
Autores: Jordan Rose, Field Application Engineer en Rutronik, y Stephan Menze, Head of Global Innovation Management en Rutronik
Interfaz multimodal basada en PSOC
Tacto, voz y gestos: un demostrador muestra cómo puede implementarse una interacción hombre-máquina moderna en espacios reducidos. La inteligencia embebida combinada con interfaces flexibles permite conceptos de manejo intuitivos y altamente reactivos.
La forma en que las personas interactúan con las máquinas evoluciona a gran velocidad. Aunque las pantallas táctiles ya forman parte de la vida cotidiana, los conceptos de operación sin contacto adquieren cada vez más importancia, especialmente en aplicaciones donde la higiene, las condiciones ambientales o las limitaciones físicas desempeñan un papel relevante.
El demostrador presentado (Figura 1) muestra cómo pueden combinarse diferentes principios de sensorización —radar, voz y tacto— en un único sistema embebido para crear una interfaz hombre-máquina (HMI) robusta. El objetivo era demostrar la fiabilidad del sistema de reconocimiento frente a influencias externas como la luz solar intensa, la lluvia, el ruido ambiental o situaciones en las que las manos están sucias o se utilizan guantes. Desarrollado en el marco de proyectos internos y de clientes, el demostrador sirve como base práctica para transferir conocimientos sobre hardware, software y algoritmos de reconocimiento gestual mediante radar y control por voz.
Arquitectura general del sistema
El demostrador reúne en un diseño compacto todos los elementos esenciales de una interfaz hombre-máquina multimodal moderna. La integración de control gestual y por voz, control de motores y visualización gráfica requiere una arquitectura cuidadosamente coordinada que permita gestionar diversas interfaces de sensores y actuadores, además de soportar procesamiento paralelo en tiempo real.
Uno de los principales desafíos consistió en integrar componentes heterogéneos con interfaces eléctricas diferentes —desde conexiones de pantalla de alta velocidad hasta entradas de sensores críticas en términos de latencia— sobre una única plataforma de microcontrolador. El Infineon PSOC Edge proporciona la capacidad de procesamiento y los periféricos necesarios para el tratamiento de señales y el control. El sistema operativo en tiempo real FreeRTOS coordina las tareas individuales y administra los flujos de datos y comandos de control a través del bus interno AHB.
| Componentes | Propiedad | Función |
| Motor BLDC con sensores Hall | Control mediante PWM y GPIO (sensores Hall) | Ajuste de velocidad y sentido de giro; realimentación de la posición del rotor |
| Micrófono MEMS digital IM69D130 XENSIV de Infineon | Conexión mediante interfaz digital PDM | Captura de señales de audio para keyword spotting |
| Pantalla táctil IPS TFT LCD 1024 × 600 de Raystar | Conexión MIPI DSI, tecnología táctil capacitiva | Visualización de estados del sistema y operación táctil |
| Radar de 60 GHz BGT60TR13C de Infineon | Conexión mediante SPI y GPIO | Reconocimiento gestual mediante análisis de magnitud, distancia y azimut |
| Placa de control de motor IFX007T de Infineon | Módulo de triple medio puente | Control de potencia del motor BLDC |
| Placa de evaluación con PSOC Edge de Infineon | Microcontrolador multinúcleo con NPU (Neural Processing Unit) | Procesamiento centralizado de señales radar, audio, visualización y control de motor |
Tabla 1. componentes principales del demostrador
Reconocimiento gestual mediante radar de 60 GHz
El reconocimiento gestual constituye el elemento central de control del demostrador. Se detectan movimientos hacia la izquierda y hacia la derecha, que aumentan o reducen la velocidad del motor, así como un gesto de “empuje” para detenerlo. El núcleo del sistema es un sensor radar FMCW de 60 GHz para la detección de movimiento. Todo el procesamiento de señales se ejecuta en el núcleo Cortex‑M55 del PSOC Edge. Dado que no se utiliza aprendizaje automático, se reduce el tiempo de desarrollo y se elimina la necesidad de entrenamiento.
Proceso de reconocimiento gestual (Figura 2):
• Datos de entrada: magnitud y AoA (ángulo de llegada), utilizando únicamente el azimut, ya que actualmente solo se distinguen las direcciones izquierda y derecha.
• Captura: radar FMCW de 60 GHz con una antena transmisora y tres receptoras, proporcionando una señal independiente por antena.
• Detección de movimiento: FFT Doppler para cada señal de antena con el fin de identificar objetivos en movimiento y suprimir objetos estáticos.
• Determinación de dirección: cálculo del ángulo de azimut a partir de las diferencias de fase entre las antenas receptoras.
• Clasificación de gestos: análisis de la evolución temporal del ángulo de azimut para detectar movimientos como “deslizamiento a la izquierda”, “deslizamiento a la derecha” o “clic”.

Figura 2. Reconocimiento gestual mediante el radar BGT60TR13C de Infineon. (Fuente: Rutronik System Solutions)
La latencia es de aproximadamente 10 ms después de finalizar el movimiento. Los gestos pueden reconocerse a distancias de entre 5 y 30 cm, o incluso mayores si se configura adecuadamente el sistema, incluso bajo condiciones complejas de reflexión y factores ambientales típicos como la luz solar. La incorporación de la elevación (ángulo vertical) permitiría reconocer gestos adicionales como movimientos ascendentes o descendentes.
El reconocimiento gestual se complementa con control por voz basado en keyword spotting. Las señales de voz son captadas por un micrófono MEMS, preprocesadas en el Cortex‑M55 del PSOC Edge y evaluadas mediante una red neuronal entrenada. Esta red, formada por múltiples capas convolucionales, está optimizada para reconocer un conjunto limitado de palabras clave claramente definidas, como “start” o “stop”.
El modelo fue desarrollado en Python utilizando Keras y TensorFlow y posteriormente adaptado al PSOC Edge mediante el ML Configurator de Infineon. La inferencia se ejecuta en el Cortex‑M55 utilizando TensorFlow Lite Micro optimizado.
Proceso de keyword spotting (Figura 3):
• Captura de audio: el micrófono MEMS digital (16 kHz) proporciona datos PDM.
• Preprocesamiento: conversión a banco de filtros MEL mediante segmentación temporal (≈530 µs).
• Inferencia: evaluación de espectros MEL mediante una CNN de múltiples capas convolucionales.
• Resultado: la palabra clave reconocida se transmite como comando de control al motor o a otras funciones del sistema.

Figura 3. Proceso de keyword spotting. (Fuente: Rutronik System Solutions)
Control de motores BLDC con sensores Hall
Un motor de corriente continua sin escobillas (24 V, máximo 4.800 rpm), controlado directamente por el microcontrolador, proporciona una respuesta inmediata a los comandos gestuales y de voz. Gracias a los sensores Hall integrados, el sistema detecta la velocidad actual y la ajusta según las órdenes recibidas.
Para el control se utiliza el módulo de triple medio puente IFX007T de Infineon, accionado mediante señales PWM y líneas digitales de control. La regulación de velocidad se realiza a una frecuencia de muestreo de 1 kHz, garantizando cambios rápidos y precisos.
Interfaz de usuario con pantalla táctil
La visualización de los estados del sistema se realiza mediante una pantalla táctil capacitiva de 7 pulgadas con resolución de 1.024 × 600 píxeles. Entre otros datos, se muestran la velocidad del motor, los gestos reconocidos y el estado del control por voz.
La interfaz gráfica se genera directamente en el microcontrolador utilizando la biblioteca de código abierto LVGL. El uso eficiente de memoria y recursos de procesamiento permite ejecutar simultáneamente la interfaz gráfica, el reconocimiento gestual y el procesamiento de voz en tiempo real. La tasa de refresco de aproximadamente 10 FPS es suficiente para mostrar estados y proporcionar retroalimentación operativa.
Retos específicos y aprendizajes
Una característica destacada del demostrador es la comparación directa entre dos enfoques: procesamiento convencional de señales y aprendizaje automático. En el caso del reconocimiento gestual mediante radar de 60 GHz, se prescindió deliberadamente del aprendizaje automático porque no era necesario desde el punto de vista funcional. Esto permite una detección robusta, rápida y sin necesidad de entrenamiento, además de una elevada inmunidad frente a la luz externa, interferencias acústicas y variaciones en la posición de la mano.
Por el contrario, el control por voz mediante keyword spotting sí emplea una red neuronal previamente entrenada y optimizada para un conjunto reducido de palabras clave. En este ámbito, el aprendizaje automático despliega todo su potencial, permitiendo responder con precisión a eventos recurrentes claramente definidos. Los algoritmos se basan en conjuntos de datos públicos utilizados para mejorar la estabilidad del reconocimiento.
Este enfoque híbrido —utilizar procesamiento clásico de señales donde aporta velocidad y robustez, y aprendizaje automático donde mejora la capacidad de reconocimiento— demuestra cómo pueden combinarse distintos métodos para desarrollar una solución HMI práctica y versátil.
Otro objetivo era demostrar que todas las funciones —reconocimiento gestual, control por voz, control de motor y visualización gráfica— pueden implementarse íntegramente en un único microcontrolador. Para lograrlo fue necesaria una integración perfecta de hardware y software, así como el procesamiento en tiempo real de múltiples flujos de datos de sensores dentro de los recursos limitados de una plataforma embebida. Esto implicó coordinar diferentes interfaces, minimizar latencias y asignar prioridades de forma eficiente. La arquitectura modular y la estricta separación funcional permiten adaptar el sistema con flexibilidad a diferentes aplicaciones y ofrecen a los desarrolladores una base lista para usar.
Perspectivas y transferencia a aplicaciones reales
La combinación de radar, audio y control de motores en un único sistema no solo constituye una demostración de viabilidad tecnológica, sino también una plataforma práctica para la transferencia de conocimiento. Los clientes se benefician de ejemplos de software listos para utilizar que les permiten realizar pruebas propias o desarrollar rápidamente aplicaciones específicas, reduciendo significativamente los tiempos de implementación.
El demostrador puede utilizarse como plataforma de referencia y adaptarse a proyectos concretos. También resulta adecuado para entornos especiales como salas limpias o cajas de guantes. La plataforma de hardware y software, junto con recursos complementarios —código de ejemplo, esquemas eléctricos, notas de aplicación e instrucciones— puede proporcionarse bajo solicitud. Asimismo, es posible realizar adaptaciones específicas, por ejemplo mediante la integración de nuevas funciones, modificaciones en el reconocimiento de voz o ampliaciones de las capacidades de reconocimiento gestual.
Un ejemplo de transferibilidad es la implementación de una red neuronal en una plataforma RDK2 junto con un radar RAB3. Una vez comprendidos los principios de adquisición de datos, entrenamiento y despliegue de redes neuronales, estos métodos pueden trasladarse fácilmente a otras plataformas. El ecosistema de herramientas de Infineon respalda este proceso y simplifica la portabilidad.
Además, están previstas futuras ampliaciones en el ámbito de la tecnología radar con el fin de desarrollar nuevos casos de uso y ampliar el abanico funcional. Por ello, el demostrador no es solo una plataforma tecnológica actual, sino también una base abierta para el desarrollo de soluciones HMI inteligentes basadas en sensores para entornos embebidos.





