Η συναρμολόγηση επίπλων IKEA γίνεται πλέον πεδίο δοκιμής για την τεχνητή νοημοσύνη, καθώς ο μη κερδοσκοπικός οργανισμός έρευνας Epoch AI παρουσίασε το Furniture Assembly Benchmark. Το πείραμα βάζει τα κορυφαία μοντέλα τεχνητής νοημοσύνης να εντοπίσουν λάθη σε εικόνες από στάδια συναρμολόγησης επίπλων IKEA. Οι ερευνητές Έιντεν Έιμεντ και Γκρεγκ Μπέρνχαμ σχεδίασαν τη δοκιμασία ώστε να μετρήσει τη λογική, τη χωρική αντίληψη και την ικανότητα εντοπισμού σφαλμάτων των μοντέλων σε μια δραστηριότητα άμεσα συνδεδεμένη με την καθημερινότητα. Το αποτέλεσμα αποκαλύπτει πόσο κοντά, ή πόσο μακριά, βρίσκεται σήμερα η τεχνητή νοημοσύνη από την πρακτική αντίληψη που διαθέτει ο άνθρωπος.
Πώς δοκιμάστηκαν τα μοντέλα
Σύμφωνα με την περιγραφή του πειράματος, τα μοντέλα καλούνται να εξετάσουν εικόνες από διαφορετικά στάδια συναρμολόγησης ενός επίπλου και να εντοπίσουν τι έχει γίνει λάθος, σε ποιο ακριβώς σημείο και για ποιον λόγο. Η αρχική ιδέα των ερευνητών της Epoch AI ήταν διαφορετική: να ζητήσουν από τα μοντέλα να δώσουν τα ίδια οδηγίες συναρμολόγησης και στη συνέχεια να τις ακολουθήσουν βήμα προς βήμα, σαν να κατασκεύαζαν τα ίδια το έπιπλο. Τα αποτελέσματα εκείνης της προσέγγισης ήταν, όπως περιγράφει ο Γκρεγκ Μπέρνχαμ, συχνά χαοτικά, κάτι που οδήγησε την ομάδα να αλλάξει εντελώς μεθοδολογία.
Η τελική προσέγγιση έβαλε την τεχνητή νοημοσύνη στη θέση του ελεγκτή και όχι του κατασκευαστή. Αντί να ζητηθεί από τα μοντέλα να συναρμολογήσουν τα ίδια ένα έπιπλο, τους ζητήθηκε να εντοπίσουν τα λάθη που είχαν ήδη κάνει άνθρωποι κατά τη συναρμολόγηση επίπλων IKEA. Για το πείραμα επιλέχθηκαν τρία προϊόντα της IKEA, καθένα με διαφορετικό βαθμό δυσκολίας σύμφωνα με τον επίσημο δείκτη πολυπλοκότητας της εταιρείας. Οι ερευνητές φωτογράφισαν δεκάδες στάδια συναρμολόγησης, ενσωματώνοντας σε αρκετά από αυτά σκόπιμα λάθη, ώστε τα μοντέλα να τα εντοπίσουν με βάση αποκλειστικά την οπτική πληροφορία που είχαν μπροστά τους.
Γιατί επιλέχθηκε η συναρμολόγηση επίπλων IKEA
Το ερώτημα γιατί επιλέχθηκε συγκεκριμένα η IKEA ως πεδίο δοκιμής δεν είναι τυχαίο. Σε μια περίοδο κατά την οποία οι εταιρείες τεχνολογίας παρουσιάζουν διαρκώς ισχυρότερα μοντέλα με νέες δυνατότητες, η πραγματική σύγκριση των επιδόσεών τους δεν είναι πάντα εύκολη υπόθεση για τους ερευνητές. Η ομάδα της Epoch AI αναζητούσε έναν τρόπο να δοκιμάσει την τεχνητή νοημοσύνη σε μια δραστηριότητα που απαιτεί ταυτόχρονα κατανόηση κειμένου, οπτική και χωρική αντίληψη, λογική σκέψη και επίλυση προβλημάτων. Η συναρμολόγηση επίπλων IKEA συγκεντρώνει όλα αυτά τα στοιχεία σε ένα ενιαίο, μετρήσιμο τεστ, κάτι σπάνιο για τα σημερινά εργαλεία αξιολόγησης τεχνητής νοημοσύνης.
Η προσέγγιση αυτή θεωρήθηκε από τους ερευνητές πιο κοντά στις πραγματικές συνθήκες χρήσης της τεχνητής νοημοσύνης στην καθημερινότητα. Ένα λάθος κατά τη συναρμολόγηση δεν αποτελεί απαραίτητα πρόβλημα, εφόσον μπορεί να αναγνωριστεί και να διορθωθεί έγκαιρα πριν ολοκληρωθεί η διαδικασία. Αυτή η λογική, να μπορεί δηλαδή ένα σύστημα να επιβλέπει και να διορθώνει μια εργασία αντί απλώς να την εκτελεί από την αρχή, θεωρείται από τους ερευνητές πιο ρεαλιστικό σενάριο χρήσης σε σχέση με το να ζητηθεί από ένα μοντέλο να εκτελέσει ολόκληρη τη διαδικασία μόνο του. Το Furniture Assembly Benchmark προστίθεται έτσι σε μια σειρά νέων δοκιμασιών που επιχειρούν να αξιολογήσουν την τεχνητή νοημοσύνη πέρα από τις παραδοσιακές γλωσσικές και μαθηματικές εξετάσεις, εστιάζοντας σε δεξιότητες που συνδέονται άμεσα με καθημερινές, πρακτικές εργασίες του πραγματικού κόσμου.




