Google AI: Ανέπτυξε οπτικοακουστικό μοντέλο για να ξεχωρίζουμε τις φωνές μέσα σε πλήθος

Η Google αναφέρει πως οι άνθρωποι είναι πολύ καλοί στο να ξεχωρίσουν τη φωνή που θέλουν να ακούσουν με το να στρέψουν την προσοχή τους στην πηγή από την οποία προέρχεται. Η ικανότητα αυτή ονομάζεται “cocktail party effect”, την οποία οι υπολογιστές δε διαθέτουν και για αυτό το λόγο η Google ανέπτυξε ένα τέτοιο οπτικοακουστικό μοντέλο για το διαχωρισμό ομιλίας ανάμεσα σε πολλές στον ίδιο χώρο.

Το “cocktail party effect” είναι η ικανότητα του εγκεφάλου να συγκεντρώνεται σε μια ακουστική πηγή σε χώρο που υπάρχουν και άλλες ταυτόχρονα, απομονώνοντας τις υπόλοιπες, όπως όταν βρισκόμαστε σε party και επικεντρώνουμε την προσοχή και την ακουστική μας ικανότητα σε ένα πρόσωπο, αγνοώντας τις ομιλίες των παρευρισκομένων. Ο διαχωρισμός αυτός δεν έχει να κάνει μόνο με το διαχωρισμό της φωνής αλλά και ήχων που ακούγονται ταυτόχρονα και στην ουσία ακούμε αυτόν που επιθυμούμε εμείς.

Η Google κατάφερε να παράξει video στο οποίο μπορεί να αυξήσει την ένταση της φωνής σε ορισμένους ανθρώπους που μιλάνε ενώ ταυτόχρονα μειώνει την ένταση σε άλλους που δε θέλουν να ακούγονται. Η μέθος της Google δουλεύει σε video με το “κανάλι” του ήχου να δίνει τη δυνατότητα στο θεατή του video να επιλέξει ποιόν επιθυμεί να ακούει κατά την αναπαραγωγή του video.

Αυτή η μέθοδος μπορεί να έχει εφαρμογή, σύμφωνα με τη Google, σε τηλεδιασκέψεις, στη βελτίωση ανθρώπων με προβλήματα ακοής αλλά και σε περιπτώσεις όπου μιλάνε πολλοί άνθρωποι ταυτόχρονα και πρέπει κάποιος να ακούγεται πιο δυνατά και άλλος πιο χαμηλά. Η τεχνική αυτή βασίζεται στο συνδιασμό οπτικοακουστικών σημάτων μέσα σε ένα video για να μπορεί να γίνει ο διαχωρισμός της φωνής. Η μέθοδος στη συνέχεια καταγράφει την κίνηση των χειλιών του στόματος και τη συσχετίζει με την ομιλία του, επιτρέποντας να ξεχωρίζει σε ποιόν ομιλητή ανήκει η φωνή που ακούγεται.

Για να γίνει η πρακτική αυτής της μεθόδου, η Google χρησιμοποίησε 100.000 υψηλής ποιότητας video με ομιλίες και διαλέξεις από το YouTube και κατάφερε να κάνει “εξαγωγή” καθαρής ομιλίας χωρίς να ακούγεται μουσική και ήχοι από το κοινό που παρακολουθούσε, έτσι ώστε να “εκπαιδεύσει” ένα μοντέλο συνελικτικών νευρωνικών δικτύων για να ξεχωρίσει την ομιλία του καθενός σε ξεχωριστά “κανάλια” ήχου. Αυτά στη συνέχεια αναπαριστώνται με τη μορφή κυματομορφής ήχου και μπορεί ο κάθε χρήστης να δυναμώσει την ένταση της φωνής ενός ομιλητή, απομονώνοντας τους άλλους, όπως εξάλλου φαίνεται και στο παράδειγμα που αναπαριστά το video.

google ai ανέπτυξε οπτικοακουστικό μοντέλο διαχωρισμό φωνής σε πλήθος, Google AI: Ανέπτυξε οπτικοακουστικό μοντέλο για να ξεχωρίζουμε τις φωνές μέσα σε πλήθος

Πηγή

Λάτρης της τεχνολογίας τα τελευταία 20 χρόνια και παιδί της πληροφορικής με σπουδές στην Αγγλία. Fan της Apple και δεν το κρύβει αλλά καταφέρνει και αντιμετωπίζει την τεχνολογία με αντικειμενικότητα, παρακολουθώντας τα τεχνολογικά δρώμενα σε καθημερινή βάση.

ΣΥΖΗΤΗΣΗ

Παρακολουθήστε τα σχόλια
Να ειδοποιηθώ όταν
guest

1 Σχόλιο
παλαιότερο
νεώτερο
Inline Feedbacks
View all comments
tson

tromaktiko

ΔΙΑΒΑΣΤΕ ΕΠΙΣΗΣ

Software Android Google

Gemini για Android: Θα σας επιτρέπει να ανεβάσετε αρχεία PDF

Η εφαρμογή Gemini στο Android λαμβάνει συνεχώς βελτιώσεις από όταν κυκλοφόρησε στις αρχές του έτους, αποκτώντας νέες δυνατότητες.

Software Android featured Google

Android 15 Beta 1.1: Διορθώνει προβλήματα με τις ανέπαφες πληρωμές NFC και Google Wallet

Η Google κυκλοφόρησε μια μικρή ενημέρωση κώδικα για το τρέχον πρόγραμμα Android 15 Beta, η οποία αντιμετωπίζει ορισμένα ζητήματα.

Smartphones Google Pixel Pixel 7

Google Pixel 7 & Pixel 8: Δεύτερη ενημέρωση Απριλίου επιλύει προβλήματα δικτύου

Μετά την εγκατάσταση της μηνιαίας ενημέρωσης Μαρτίου 2024, χρήστες συσκευών Pixel 7 και Pixel 8 αντιμετώπισαν διάφορα προβλήματα δικτύου.

Smartphones featured Google Pixel

Google Pixel 8a: Διέρρευσε (και) η τιμή – Πόσο ακριβότερο θα είναι από το 7a;

Μια ακόμα είδηση έρχεται από το μέτωπο της Google και αυτή τη φορά αφορά το Pixel 8a και συγκεκριμένα την τιμή του.