Inicio Artículos La IA sienta las bases para mejorar la autonomía de los robots

La IA sienta las bases para mejorar la autonomía de los robots

La IA sienta las bases para mejorar la autonomía de los robots

Autor: Martin Unverdorben, Technical Information Manager, Tria Technologies

La Inteligencia Artificial (IA) supone toda una revolución en la arquitectura de la robótica. La IA permite crear máquinas mucho más flexibles que los diseños convencionales. Estas máquinas seguirán siendo capaces de realizar las operaciones precisas y repetibles que necesitan los sistemas de fabricación, pero además la IA es capaz de proporcionar una supervisión de alto nivel que no solo deja que los robots se muevan fuera de las jaulas de seguridad; además logra que se adapten mucho mejor a nuevas tareas.

La incorporación de la IA evita tener que cambiar la programación determinística en la que se basa el movimiento robótico. La IA añade nuevas capas al stack de software del robot que le permiten adaptarse directamente a nuevas situaciones. En el interior del robot, la IA se encarga de supervisar los diversos tipos de movimientos que han desarrollado los ingenieros a lo largo de los años con el fin de realizar operaciones de bajo nivel con precisión.

La IA ofrece la posibilidad de manejar entornos no estructurados. Para los fabricantes de robots, las prestaciones superiores de la IA representan una gran oportunidad para ganar cuota de mercado en sus inicios. Esta nueva flexibilidad también puede reducir el tiempo preciso para que los robots sean útiles en su área de trabajo. En lugar de recurrir a programas o secuencias de acciones de carácter fijo que los desarrolladores necesitan crear para que un robot desempeñe tareas útiles, las máquinas potenciadas con IA pueden aprender a imitar las acciones humanas y a vincular tales acciones entre sí de forma sofisticada como respuesta a instrucciones orales o visuales.

Para aprovechar el potencial de la IA es importante segmentar las diferentes modalidades y utilizarlas para construir una arquitectura sólida para robótica. El primer paso consiste en facilitar que el robot procese las entradas procedentes de su entorno. Tales entradas tienen su origen principalmente en los sistemas de visión artificial, aunque pueden estar potenciadas por otras señales. Por ejemplo, los sensores que registran presión y posición pueden ser muy valiosos para dotar al robot de una imagen más nítida de sus alrededores y de los objetos que manipula.

La arquitectura de la red neuronal convolucional o CNN (convolutional neural network) sigue siendo la mejor tecnología basada en aprendizaje automático para interpretar las entradas de las cámaras y otros sensores. La CNN, diseñada para datos correspondientes a topologías de tipo cuadrícula, aprovechan los patrones de los píxeles o las muestras cercanas para facilitar la detección de bordes y otros rasgos en sus capas iniciales. Las capas sucesivas recogen la información procedente de estas primeras capas para extraer rasgos importantes. Las capas totalmente conectadas utilizan los rasgos de bajo nivel para efectuar predicciones y tomar decisiones sobre los datos entrantes. El resultado es un canal eficiente para interpretar y clasificar rasgos en las entradas de los sensores con el fin de ofrecer soporte a las tareas asignadas, incluidos otros modelos de IA. La sensibilidad frente a diferencias locales entre píxeles permite que una CNN detecte diferencias entre materiales y objetos que proporcione interacciones más complejas con el mundo físico.

En un robot con IA, las predicciones y las clasificaciones efectuadas por una o más CNN se pueden introducir en un modelo fundacional. La estructura Transformer, destinada al modelo funcional y desarrollada inicialmente para el procesamiento de lenguaje natural, ha demostrado ser muy efectiva para interpretar información e incluso razonamiento. Gracias a esta capacidad, los modelos funcionales más avanzados ofrecen la posibilidad de planificación autónoma y descomposición de tareas en subtareas y perfiles de movimiento que pueden ser implementados por los sistemas de control de menor nivel en el robot.

Los modelos más sencillos pueden procesar lenguaje natural convirtiendo las frases habladas en frases textuales que pueden indicar al robot que realice determinadas tareas. Además los modelos de texto a voz pueden dotar al robot de la capacidad de comunicar lo que está haciendo a los usuarios.

En esta arquitectura, varios modelos de IA pueden interactuar entre sí y con software de nivel más bajo. Las CNN gestionan las entradas de los sensores y proporcionan información a los modelos de IA basados en Transformer. Un modelo así puede interpretar los comandos de voz y otros tipos de entradas, mientras que un modelo fundacional de mayor tamaño toma el control de la planificación de la trayectoria, la interpretación y la secuenciación de las políticas de movimiento que el robot ejecuta a continuación.

La baja latencia de respuesta es un aspecto vital en el diseño del robot. Las plataformas basadas en la nube pueden proporcionar acceso a avanzados modelos fundacionales, pero su uso implica una latencia de comunicación significativa. Un centro de datos remoto debe esperar que los datos recorran cientos de kilómetros antes de que el propio modelo fundacional pueda generar tokens que alejarán al robot frente ante un peligro o un error. Puede resultar valioso recurrir a modelos fundacionales basados en la nube para planificar trayectorias y coordinar robots antes de iniciar una tarea. Pero la IA local o basada en la periferia (edge) se convertirá en un elemento clave para que las máquinas se puedan mover por entornos no estructurados.

Gracias a las mejoras en las prestaciones del hardware y eficiencia del modelo, resulta viable desplegar modelos fundaciones junto con IA para visión en el robot. Los fabricantes del sector de la robótica están evaluando cómo implementar estas cargas de trabajo de la IA cada vez más complejas en la periferia y muchos de ellos están recurriendo a especialistas en computación embebida como Tria que les ayuden a identificar la combinación óptima de rendimiento del procesamiento, eficiencia de consumo y escalabilidad para los sistemas autónomos de próxima generación.

Los fabricantes de hardware embebido han diseñado aceleradores que optimizan el rendimiento de las redes neuronales. Algunos utilizan principalmente CNN, pero desarrollos recientes como Dragonwing de Qualcomm incorporan funciones que mejoran el rendimiento de los modelos basados en Transformer.

El entrenamiento de estos sistemas puede exigir un uso intensivo de la nube. El uso de gemelos digitales es un buen ejemplo ya que utiliza una presentación virtual del robot que se ejecuta en la nube para procesar estímulos a mayores velocidades y con más facilidad que con hardware físico. Los gemelos digitales pueden aprovechar modelos matemáticos para simular interacciones en el software que equivalen a su desempeño en el mundo físico.

El empleo de grabaciones de vídeo de las demostraciones de tareas permite que el gemelo digital evalúa las prestaciones del robot al realizar las mismas acciones. Las desviaciones respecto al comportamiento ideal se pueden aprovechar a continuación como datos para entrenar los modelos de IA subyacentes con el fin de obtener el mejor rendimiento. Dado que estos procesos se pueden efectuar a velocidades muy superiores al tiempo real, los gemelos digitales acelerarán el desarrollo.

La incorporación de IA a los robots hace que sean más flexibles no debería comprometer el objetivo principal del diseño de garantizar su funcionamiento seguro. Los robots han venido funcionando hasta ahora en la mayoría de los casos dentro de jaulas de seguridad de tipo físico. El modelado mediante gemelos digitales es un paso adelante ya que está en condiciones de simular situaciones inseguras por completo en el dominio del software. Pero la barrera de software que protege el modelo fundacional suministrará una jaula de seguridad virtual y este software puede funcionar a varios niveles.

Un tipo de barrera de seguridad guarda relación con las instrucciones a los modelos fundacionales. Estas barreras comprueban los comandos enviados por los usuarios al robot y determinan si alguno de ellos conllevará un funcionamiento inseguro. Si es así, la barrera de seguridad impedirá que la entrada sea utilizada erróneamente como instrucción por parte del modelo fundacional. Las barreras de seguridad pueden funcionar con niveles más bajos: pueden decodificar las entradas de sensores de presión u otros sensores para comprobar que la máquina no corre el riesgo de colisionar o de detenerse si se aplica demasiada presión sobre a un objeto. Además, las técnicas que priorizan conclusiones explicables ayudarán a mejorar la coordinación entre los modelos de IA y sus barreras de seguridad.

La implementación de IA en la robótica puede ser compleja y esto hace que la colaboración con otras empresas sea primordial. Los fabricantes de robots saldrán beneficiados por las conexiones más sólidas con expertos en ecosistemas de software, sensores y semiconductores para IA. El uso de plataformas nativas de IA es otro paso que pueden dar los equipos de desarrollo para mejorar su plazo de comercialización en lugar de intentar que los modelos funcionen sobre ordenadores embebidos de tipo convencional. También tiene sentido escoger arquitecturas modulares y actualizables ya que se adaptan mejor a los rápidos avances en el ámbito de la IA y a los diversos tipos de hardware de aceleración que necesitarán. A medida que las cargas de trabajo de la IA son más exigentes, la selección de la adecuada plataforma informática embebida se convierte en una decisión primordial del diseño para los fabricantes de robótica. Lograr el equilibrio requerido entre rendimiento, eficiencia energética, gestión térmica y escalabilidad a largo plazo exige conocer a fondo tanto el stack de software de la IA como la arquitectura de hardware subyacente. La colaboración con un especialista en computación embebida que colabore estrechamente con las mayores compañías de semiconductores y otras tecnologías será imprescindible para que los diseñadores puedan identificar e integrar plataformas optimizadas para aplicaciones de la IA en el ámbito de visión, IA generativa e inferencia en la periferia.

Empresas como Tria ofrecen un soporte a los desarrolladores de robótica que va más allá de la selección del hardware y a lo largo de todo el proceso de desarrollo para ayudarles a moverse con rapidez entre ecosistemas de IA y a adoptar arquitecturas que se puedan actualizar a medida que cambian los modelos y los requisitos. Gracias a la suma del acceso a plataformas de computación preparadas para la IA y un enfoque orientado a ecosistemas, Tria se halla en excelentes condiciones para ayudar a los fabricantes de robots a acelerar el desarrollo de sistemas autónomos y a comercializar soluciones robóticas de próxima generación con más rapidez.