Μέσα στη συζήτηση για το πού πάει το ελληνικό οπτικοακουστικό, μια πρωτοβουλία ξεχωρίζει γιατί κοιτάζει πιο μακριά από το επόμενο γύρισμα. Το Υπουργείο Πολιτισμού, σε συνεργασία με το Εθνικό Μετσόβιο Πολυτεχνείο, τρέχει πιλοτικά προγράμματα ψηφιοποίησης της πολιτιστικής κληρονομιάς - με προτεραιότητα σε μνημεία UNESCO - ώστε η ελληνική γλώσσα και το περιεχόμενο να μπουν στις βάσεις εκπαίδευσης της τεχνητής νοημοσύνης. Ο στόχος, όπως διατυπώνεται: η ελληνική να εκπαιδεύει την ΤΝ, για να μην περιθωριοποιηθεί στο νέο ψηφιακό περιβάλλον.
Γιατί δεν είναι αφηρημένο
Κάθε εργαλείο που παράγει κείμενο ή εικόνα είναι τόσο καλό όσο τα δεδομένα με τα οποία εκπαιδεύτηκε. Αν η ελληνική - και ιδίως το πολυτονικό, οι παλιές ορθογραφίες, οι διοικητικές συμβάσεις κάθε εποχής - λείπουν από αυτά τα δεδομένα, τότε ό,τι βγαίνει έξω είναι λάθος με τρόπους που μόνο ένα ελληνικό μάτι πιάνει. Το ξέρω από την καθημερινότητα: οι μισές display γραμματοσειρές δεν έχουν καν ελληνικό, το κεφαλαίο παίρνει τόνο εκεί που δεν πρέπει, μια φόρμα του '60 «μεταφράζεται» σε κάτι που δεν υπήρξε ποτέ.
Έτσι, το «να μπει η ελληνική στο training set» δεν είναι σύνθημα. Είναι το αν τα εργαλεία του αύριο θα μπορούν καν να παράγουν μια σωστή ελληνική εφημερίδα, ένα πιστευτό έγγραφο, μια σφραγίδα που κάθεται στη σωστή δεκαετία.
Η παγίδα
Η ψηφιοποίηση της κληρονομιάς μέσα σε δεδομένα εκπαίδευσης είναι παιχνίδι μακράς πνοής, με ένα πραγματικό ερωτηματικό από κάτω: ποιανού δεδομένα, με ποια άδεια, και ποιος τελικά ωφελείται. Αλλά η κατεύθυνση - να αντιμετωπίζεται η γλώσσα ως υποδομή, όχι ως διακόσμηση - είναι το σωστό ένστικτο. Για όσους από εμάς η ακρίβεια της γλώσσας είναι η δουλειά, αξίζει να την παρακολουθήσουμε στενά.
Πηγή: GOVnews / ΕΚΚΟΜΕΔ.