Το Πανεπιστήμιο του Harvard ανακοίνωσε σήμερα Πέμπτη ότι κυκλοφορεί ένα σύνολο δεδομένων υψηλής ποιότητας με σχεδόν ένα εκατομμύριο public-domain βιβλία που θα μπορούσαν να χρησιμοποιηθούν από οποιονδήποτε για την εκπαίδευση γλωσσικών μοντέλων και άλλων εργαλείων τεχνητής νοημοσύνης.
Το σύνολο των δεδομένων δημιουργήθηκε από τη νεοσύστατη Πρωτοβουλία Θεσμικών Δεδομένων του Harvard (Institutional Data Initiative) με χρηματοδότηση από την Microsoft και από την OpenAI. Περιέχει βιβλία που έχουν σαρωθεί από το Google Books project και δεν προστατεύονται πλέον από πνευματικά δικαιώματα.




