FOXreport.gr

Νέο εργαλείο της Microsoft επιτρέπει στους προγραμματιστές να δημιουργούν AI δοκιμές συμπεριφοράς από περιγραφές κειμένου

Εικόνα: newmoney.gr

Οι ερευνητές και τα εργαστήρια τεχνητής νοημοσύνης έχουν σημειώσει τεράστια πρόοδο στην αξιολόγηση των μοντέλων για ζητήματα που αφορούν την ασφάλεια, τη συμμόρφωση ή την ευθυγράμμιση. Ωστόσο, οι εταιρείες και οι προγραμματιστές βρίσκονται πλέον αντιμέτωποι με μια νέα, συγκεκριμένη ανάγκη, να διασφαλίσουν ότι το σύστημα τεχνητής νοημοσύνης συμπεριφέρεται ακριβώς όπως προβλέπεται για το συγκεκριμένο προϊόν ή την υπηρεσία τους.

Σε μια προσπάθεια να απλοποιήσει αυτή τη διαδικασία δοκιμών, η Microsoft παρουσίασε το ASSERT, το οποίο αποτελεί ακρωνύμιο του Adaptive Spec – driven Scoring for Evaluation and Regression Testing.

Microsoft: Αυτοματοποιημένες δοκιμές με βάση τη φυσική γλώσσα

Το συγκεκριμένο πλαίσιο ανοικτού κώδικα καθιστά εύκολη την αξιολόγηση της συμπεριφοράς της τεχνητής νοημοσύνης που σχετίζεται με συγκεκριμένες εφαρμογές. Χρησιμοποιεί την ίδια την τεχνητή νοημοσύνη για να μετατρέψει τις γενικές περιγραφές στόχων, πολιτικών ή επιθυμητών συμπεριφορών σε απλή γλώσσα, σε διεξοδικές και βαθμολογημένες δοκιμές που μπορούν να εξεταστούν λεπτομερώς.

Το ASSERT δέχεται περιγραφές σε απλή γλώσσα σχετικά με την αναμενόμενη συμπεριφορά και τις πολιτικές ενός μοντέλου, τις μετατρέπει σε ένα δομημένο σύνολο αποδεκτών και μη αποδεκτών συμπεριφορών, δημιουργεί σενάρια προβλημάτων και περιπτώσεις δοκιμών, τις εκτελεί έναντι του συστήματος – στόχου και βαθμολογεί τα αποτελέσματα. Μπορεί επίσης να καταγράφει τις διαδρομές που ακολουθεί το σύστημα τεχνητής νοημοσύνης, συμπεριλαμβανομένων των ενδιάμεσων ενεργειών και των κλήσεων εργαλείων, ώστε οι προγραμματιστές να μπορούν να εντοπίσουν πού ακριβώς συμβαίνουν οι αποτυχίες.

Προσαρμογή και παραδείγματα εφαρμογής

Οι προγραμματιστές έχουν τη δυνατότητα να παρέχουν το πλαίσιο του συστήματος, εργαλεία και περιορισμούς, εάν επιθυμούν να προσαρμόσουν περαιτέρω το τι καλύπτουν οι αξιολογήσεις.

Για παράδειγμα, ένας προγραμματιστής θα μπορούσε να καθορίσει ότι ένας ψηφιακός βοηθός έρευνας εγγράφων δεν πρέπει να στέλνει μηνύματα ηλεκτρονικού ταχυδρομείου σε άτομα εκτός της εταιρείας, ότι πρέπει να περιορίζει τις εμπιστευτικές πληροφορίες μόνο στα στελέχη ανώτατου επιπέδου και να παρέχει συνοπτικές περιλήψεις λαμβάνοντας υπόψη το προηγούμενο πλαίσιο. Το ASSERT θα χρησιμοποιήσει αυτούς τους κανόνες για να δημιουργήσει περιπτώσεις δοκιμών που ελέγχουν αν το σύστημα ακολουθεί τους κανόνες αυτούς σε συνεχή βάση.

Κάλυψη του κενού στις γενικές αξιολογήσεις

Το πλαίσιο αυτό έρχεται να καλύψει ένα κενό που οι ευρύτερες, πιο γενικές αξιολογήσεις δεν μπορούν να καλύψουν, όταν τα μοντέλα τεχνητής νοημοσύνης προορίζονται να συμπεριφέρονται με τρόπο που διαμορφώνεται από το πλαίσιο, τις πολιτικές και τα εργαλεία μιας συγκεκριμένης εφαρμογής ή προϊόντος.

Η Sarah Bird, επικεφαλής προϊόντος Υπεύθυνης Τεχνητής Νοημοσύνης στη Microsoft, επεσήμανε ότι οι αξιολογήσεις είναι απολύτως κρίσιμες για τη λήψη σωστών αποφάσεων. Εάν δεν είναι κατανοητή η συμπεριφορά του συστήματος, είναι πολύ δύσκολο να γνωρίζει κανείς αν ανταποκρίνεται στα κριτήρια του οργανισμού. Για να υπάρχει ένα πραγματικά αξιόπιστο σύστημα, θα πρέπει να αξιολογούνται πολλές περισσότερες διαστάσεις που είναι εξειδικευμένες για την εκάστοτε εφαρμογή. Το εργαλείο μπορεί να χρησιμοποιηθεί κατά τη διάρκεια της κατασκευής των συστημάτων, μετά την εγκατάσταση, ακόμη και για συνεχή παρακολούθηση.

Η κυκλοφορία αυτή συμπίπτει με μια ευρύτερη στροφή στη βιομηχανία της τεχνητής νοημοσύνης. Καθώς τα μοντέλα γίνονται πιο ικανά, οι ερευνητές επικεντρώνονται σε επαναλαμβανόμενες δοκιμές και ελέγχους παλινδρόμησης, με διάφορους οργανισμούς και ερευνητικές ομάδες να παρουσιάζουν σημεία αναφοράς για τη μέτρηση της συμπεριφοράς των μοντέλων υπό διαφορετικές συνθήκες.

Exit mobile version