Μια ομάδα επιστημόνων ανέπτυξε ένα νέο σύστημα τεχνητής νοημοσύνης που επιτρέπει στα ρομπότ να σχεδιάζουν την επόμενη κίνησή τους ενώ βρίσκονται ήδη σε κίνηση, εξαλείφοντας τις καθυστερήσεις αντίδρασης που ταλαιπωρούν τα σύγχρονα ρομποτικά συστήματα. Το σύστημα ονομάζεται VLASH και, σύμφωνα με τη μελέτη που το περιγράφει, διπλασιάζει την ταχύτητα εκτέλεσης εργασιών χωρίς επιπλέον υπολογιστικό κόστος. Η χρήση τεχνητής νοημοσύνης σε ρομπότ που ελέγχονται από μοντέλα όρασης-γλώσσας-δράσης αφορά κυρίως εργασίες που απαιτούν συνεχή αλληλεπίδραση σε πραγματικό χρόνο. Οι ερευνητές θα παρουσιάσουν τα ευρήματά τους στο συνέδριο Intelligent Robots and Systems το φθινόπωρο.
Πώς λειτουργεί το νέο σύστημα τεχνητής νοημοσύνης
Τα περισσότερα ρομπότ που καθοδηγούνται από μοντέλα Vision-Language-Action (VLA) δεν κινούνται ομαλά, αλλά με διαδοχικές παύσεις: πλησιάζουν ένα αντικείμενο, σταματούν, προσαρμόζουν την πορεία τους και σταματούν ξανά πριν συνεχίσουν. Η συμπεριφορά αυτή προκύπτει επειδή, μόλις το ρομπότ ολοκληρώσει ένα σύνολο εντολών, αναγκάζεται να περιμένει έως ότου το μοντέλο υπολογίσει το επόμενο σύνολο κινήσεων, με αποτέλεσμα έναν ρυθμό «σταμάτα και ξεκίνα». Η καθυστέρηση αυτή δυσκολεύει σημαντικά τη χρήση ρομπότ που βασίζονται σε VLA σε εργασίες που απαιτούν αδιάλειπτη αλληλεπίδραση σε πραγματικό χρόνο.
Το νέο σύστημα τεχνητής νοημοσύνης που ονομάστηκε VLASH επιχειρεί να καταργήσει αυτή την αναμονή, σχεδιάζοντας τις επόμενες κινήσεις του ρομπότ ενώ αυτό βρίσκεται ακόμη σε εξέλιξη με τις τρέχουσες. Καθώς το ρομπότ ολοκληρώνει ένα σύνολο κινήσεων, ο αλγόριθμος αξιοποιεί την τρέχουσα θέση του και τις ήδη προγραμματισμένες εντολές για να υπολογίσει πού θα βρίσκεται στο τέλος της διαδρομής. Με βάση αυτή την προβλεπόμενη κατάσταση, το σύστημα σχεδιάζει αμέσως το επόμενο σύνολο κινήσεων, χωρίς να χρειάζεται το ρομπότ να ακινητοποιηθεί. Σε αντίθεση με άλλες μεθόδους, το VLASH προβλέπει μόνο το ίδιο το ρομπότ και όχι ολόκληρο το περιβάλλον γύρω του, κάτι που θα απαιτούσε πολύ μεγαλύτερο υπολογιστικό κόστος μέσω ενός πλήρους μοντέλου κόσμου.
Στις δοκιμές που πραγματοποιήθηκαν, τα ρομπότ που λειτουργούσαν με το VLASH ολοκλήρωσαν συγκεκριμένες εργασίες 1,5 έως 2 φορές ταχύτερα, διατηρώντας παράλληλα το μεγαλύτερο μέρος ή και το σύνολο της ακρίβειάς τους. Η μέγιστη καθυστέρηση αντίδρασης περιορίστηκε έως και 11,8 φορές, ανάλογα με το υλικό του υπολογιστή που χρησιμοποιήθηκε σε κάθε δοκιμή.
Ποιοι ερευνητές βρίσκονται πίσω από το VLASH
Το σύστημα αναπτύχθηκε από ομάδα επιστημόνων του MIT, της Nvidia, του Caltech, του Πανεπιστημίου της Καλιφόρνια στο Μπέρκλεϊ, του Πανεπιστημίου της Καλιφόρνια στο Σαν Ντιέγκο, καθώς και του Tsinghua University στην Κίνα. Οι ερευνητές περιέγραψαν το VLASH σε μελέτη που πρόκειται να παρουσιαστεί στο συνέδριο Intelligent Robots and Systems το φθινόπωρο.
Μια προγενέστερη έκδοση της μελέτης ανέφερε επιτάχυνση μεγαλύτερη από 30 φορές, ωστόσο οι συγγραφείς διευκρίνισαν ότι εκείνες οι δοκιμές είχαν γίνει με μεγαλύτερες ακολουθίες κινήσεων και με πιο αργό υλικό. Τα νεότερα πειράματα χρησιμοποίησαν μικρότερες και πιο συνηθισμένες ακολουθίες κινήσεων, καθώς και ισχυρότερες κάρτες γραφικών. «Το 11,8x ίσως αντιπροσωπεύει καλύτερα τις σύγχρονες πρακτικές συνθήκες», ανέφεραν οι ερευνητές στη μελέτη τους.
Τα μοντέλα VLA λειτουργούν ως ο «εγκέφαλος» πολλών προηγμένων ρομπότ, συνδυάζοντας εικόνες από κάμερα με ανθρώπινες οδηγίες και δεδομένα για την τρέχουσα κατάσταση του ρομπότ, προτού μετατρέψουν όλες αυτές τις πληροφορίες σε πραγματικές κινήσεις. Η βελτίωση που φέρνει η τεχνητή νοημοσύνη στα ρομπότ μέσω του VLASH αφορά ακριβώς αυτή τη μετάβαση από την αντίληψη στην κίνηση, μειώνοντας τον χρόνο που μεσολαβεί ανάμεσα στις δύο φάσεις χωρίς πρόσθετο υπολογιστικό κόστος.




