Google AI: Ανέπτυξε οπτικοακουστικό μοντέλο για να ξεχωρίζουμε τις φωνές μέσα σε πλήθος

Η Google αναφέρει πως οι άνθρωποι είναι πολύ καλοί στο να ξεχωρίσουν τη φωνή που θέλουν να ακούσουν με το να στρέψουν την προσοχή τους στην πηγή από την οποία προέρχεται. Η ικανότητα αυτή ονομάζεται “cocktail party effect”, την οποία οι υπολογιστές δε διαθέτουν και για αυτό το λόγο η Google ανέπτυξε ένα τέτοιο οπτικοακουστικό μοντέλο για το διαχωρισμό ομιλίας ανάμεσα σε πολλές στον ίδιο χώρο.

Το “cocktail party effect” είναι η ικανότητα του εγκεφάλου να συγκεντρώνεται σε μια ακουστική πηγή σε χώρο που υπάρχουν και άλλες ταυτόχρονα, απομονώνοντας τις υπόλοιπες, όπως όταν βρισκόμαστε σε party και επικεντρώνουμε την προσοχή και την ακουστική μας ικανότητα σε ένα πρόσωπο, αγνοώντας τις ομιλίες των παρευρισκομένων. Ο διαχωρισμός αυτός δεν έχει να κάνει μόνο με το διαχωρισμό της φωνής αλλά και ήχων που ακούγονται ταυτόχρονα και στην ουσία ακούμε αυτόν που επιθυμούμε εμείς.

Η Google κατάφερε να παράξει video στο οποίο μπορεί να αυξήσει την ένταση της φωνής σε ορισμένους ανθρώπους που μιλάνε ενώ ταυτόχρονα μειώνει την ένταση σε άλλους που δε θέλουν να ακούγονται. Η μέθος της Google δουλεύει σε video με το “κανάλι” του ήχου να δίνει τη δυνατότητα στο θεατή του video να επιλέξει ποιόν επιθυμεί να ακούει κατά την αναπαραγωγή του video.

Αυτή η μέθοδος μπορεί να έχει εφαρμογή, σύμφωνα με τη Google, σε τηλεδιασκέψεις, στη βελτίωση ανθρώπων με προβλήματα ακοής αλλά και σε περιπτώσεις όπου μιλάνε πολλοί άνθρωποι ταυτόχρονα και πρέπει κάποιος να ακούγεται πιο δυνατά και άλλος πιο χαμηλά. Η τεχνική αυτή βασίζεται στο συνδιασμό οπτικοακουστικών σημάτων μέσα σε ένα video για να μπορεί να γίνει ο διαχωρισμός της φωνής. Η μέθοδος στη συνέχεια καταγράφει την κίνηση των χειλιών του στόματος και τη συσχετίζει με την ομιλία του, επιτρέποντας να ξεχωρίζει σε ποιόν ομιλητή ανήκει η φωνή που ακούγεται.

Για να γίνει η πρακτική αυτής της μεθόδου, η Google χρησιμοποίησε 100.000 υψηλής ποιότητας video με ομιλίες και διαλέξεις από το YouTube και κατάφερε να κάνει “εξαγωγή” καθαρής ομιλίας χωρίς να ακούγεται μουσική και ήχοι από το κοινό που παρακολουθούσε, έτσι ώστε να “εκπαιδεύσει” ένα μοντέλο συνελικτικών νευρωνικών δικτύων για να ξεχωρίσει την ομιλία του καθενός σε ξεχωριστά “κανάλια” ήχου. Αυτά στη συνέχεια αναπαριστώνται με τη μορφή κυματομορφής ήχου και μπορεί ο κάθε χρήστης να δυναμώσει την ένταση της φωνής ενός ομιλητή, απομονώνοντας τους άλλους, όπως εξάλλου φαίνεται και στο παράδειγμα που αναπαριστά το video.

google ai ανέπτυξε οπτικοακουστικό μοντέλο διαχωρισμό φωνής σε πλήθος, Google AI: Ανέπτυξε οπτικοακουστικό μοντέλο για να ξεχωρίζουμε τις φωνές μέσα σε πλήθος

Πηγή

Λάτρης της τεχνολογίας τα τελευταία 20 χρόνια και παιδί της πληροφορικής με σπουδές στην Αγγλία. Fan της Apple και δεν το κρύβει αλλά καταφέρνει και αντιμετωπίζει την τεχνολογία με αντικειμενικότητα, παρακολουθώντας τα τεχνολογικά δρώμενα σε καθημερινή βάση.

ΣΥΖΗΤΗΣΗ

Παρακολουθήστε τα σχόλια
Να ειδοποιηθώ όταν
guest
1 Σχόλιο
παλαιότερο
νεώτερο
Inline Feedbacks
View all comments
tson

tromaktiko

ΔΙΑΒΑΣΤΕ ΕΠΙΣΗΣ

Smartphones Google Google Pixel

Google Pixel 6a: Στο Best Buy πριν από την κυκλοφορία

Το Pixel 6a το περιμένουμε στα καταστήματα λιανικής τον επόμενο μήνα, ωστόσο το Best Buy έχει ήδη μια καταχώριση για το Pixel στον ιστότοπό του ως “Σύντομα”.

Software Google Google Chrome

Κυκλοφόρησε το Google Chrome 104 beta – Όλα τα νέα

Με το που κυκλοφόρησε η stable έκδοση του Chrome 103, έφτασε και η πρώτη beta του Chrome 104, με νέες δυνατότητες από τη Google.

Smartphones Google Pixel 6

Pixel 6a: Νέο hands-on βίντεο αποκαλύπτει απογοητευτική benchmark απόδοση

Τα unboxing βίντεο του Google Pixel 6a δεν έχουν σταματημό, με τη Μαλαισία να είναι στο επίκεντρο του leaking.

Internet Google

Google News: Ανανεώνεται η desktop έκδοση

Τα Google News, με αφορμή την 20η επέτειο ανανεώνονται ριζικά στην desktop έκδοση και δίνεται μεγάλη σημασία στις προσωπικές προτιμήσεις.