Google AI: Ανέπτυξε οπτικοακουστικό μοντέλο για να ξεχωρίζουμε τις φωνές μέσα σε πλήθος

Η Google αναφέρει πως οι άνθρωποι είναι πολύ καλοί στο να ξεχωρίσουν τη φωνή που θέλουν να ακούσουν με το να στρέψουν την προσοχή τους στην πηγή από την οποία προέρχεται. Η ικανότητα αυτή ονομάζεται “cocktail party effect”, την οποία οι υπολογιστές δε διαθέτουν και για αυτό το λόγο η Google ανέπτυξε ένα τέτοιο οπτικοακουστικό μοντέλο για το διαχωρισμό ομιλίας ανάμεσα σε πολλές στον ίδιο χώρο.

Το “cocktail party effect” είναι η ικανότητα του εγκεφάλου να συγκεντρώνεται σε μια ακουστική πηγή σε χώρο που υπάρχουν και άλλες ταυτόχρονα, απομονώνοντας τις υπόλοιπες, όπως όταν βρισκόμαστε σε party και επικεντρώνουμε την προσοχή και την ακουστική μας ικανότητα σε ένα πρόσωπο, αγνοώντας τις ομιλίες των παρευρισκομένων. Ο διαχωρισμός αυτός δεν έχει να κάνει μόνο με το διαχωρισμό της φωνής αλλά και ήχων που ακούγονται ταυτόχρονα και στην ουσία ακούμε αυτόν που επιθυμούμε εμείς.

Η Google κατάφερε να παράξει video στο οποίο μπορεί να αυξήσει την ένταση της φωνής σε ορισμένους ανθρώπους που μιλάνε ενώ ταυτόχρονα μειώνει την ένταση σε άλλους που δε θέλουν να ακούγονται. Η μέθος της Google δουλεύει σε video με το “κανάλι” του ήχου να δίνει τη δυνατότητα στο θεατή του video να επιλέξει ποιόν επιθυμεί να ακούει κατά την αναπαραγωγή του video.

Αυτή η μέθοδος μπορεί να έχει εφαρμογή, σύμφωνα με τη Google, σε τηλεδιασκέψεις, στη βελτίωση ανθρώπων με προβλήματα ακοής αλλά και σε περιπτώσεις όπου μιλάνε πολλοί άνθρωποι ταυτόχρονα και πρέπει κάποιος να ακούγεται πιο δυνατά και άλλος πιο χαμηλά. Η τεχνική αυτή βασίζεται στο συνδιασμό οπτικοακουστικών σημάτων μέσα σε ένα video για να μπορεί να γίνει ο διαχωρισμός της φωνής. Η μέθοδος στη συνέχεια καταγράφει την κίνηση των χειλιών του στόματος και τη συσχετίζει με την ομιλία του, επιτρέποντας να ξεχωρίζει σε ποιόν ομιλητή ανήκει η φωνή που ακούγεται.

Για να γίνει η πρακτική αυτής της μεθόδου, η Google χρησιμοποίησε 100.000 υψηλής ποιότητας video με ομιλίες και διαλέξεις από το YouTube και κατάφερε να κάνει “εξαγωγή” καθαρής ομιλίας χωρίς να ακούγεται μουσική και ήχοι από το κοινό που παρακολουθούσε, έτσι ώστε να “εκπαιδεύσει” ένα μοντέλο συνελικτικών νευρωνικών δικτύων για να ξεχωρίσει την ομιλία του καθενός σε ξεχωριστά “κανάλια” ήχου. Αυτά στη συνέχεια αναπαριστώνται με τη μορφή κυματομορφής ήχου και μπορεί ο κάθε χρήστης να δυναμώσει την ένταση της φωνής ενός ομιλητή, απομονώνοντας τους άλλους, όπως εξάλλου φαίνεται και στο παράδειγμα που αναπαριστά το video.

google_AI_voices_crowd1

Πηγή

ΣΥΖΗΤΗΣΗ

Παρακολουθήστε τα σχόλια
Να ειδοποιηθώ όταν
guest
1 Σχόλιο
παλαιότερο
νεώτερο
Inline Feedbacks
View all comments
tson

tromaktiko

ΔΙΑΒΑΣΤΕ ΕΠΙΣΗΣ

Business SpaceX

DearMoon: Ιάπωνας επιχειρηματίας μας καλεί σε ταξίδι στο φεγγάρι

Ο Ιάπωνας δισεκατομμυριούχος Yusaku Maezawa ανακοινώνει το DearMoon με σκοπό να βρει τα μέλη του πληρώματος που θα τον συνοδεύσουν στη Σελήνη.

Business China

O Jack Ma χάνει τον τίτλο του πλουσιότερου ανθρώπου στην Κίνα

Ο λόγος είναι ότι οι κινεζικές Αρχές έχουν βάλει στο μικροσκόπιο την οικονομική δραστηριότητα του Jack Ma.

Business Amazon

H Amazon αλλάζει το εικονίδιο της εφαρμογής για τις iOS και Android συσκευές

Έντονη ήταν η αντίδραση με τον παραλληλισμό του εικονιδίου λόγω της παρομοίωσης με τον Αδόλφο Χίτλερ γεγονός που συνοδεύτηκε με την αλλαγή του εικονιδίου.

Business Cisco

Cisco Digital Talks: Διάλλογοι στο Διεθνές Κέντρο Ψηφιακού Μετασχηματισμού και Ψηφιακών Δεξιοτήτων

Σκοπός μας είναι η προώθηση νέων ιδεών, καινοτόμων προσεγγίσεων, και η ανάπτυξη του διαλόγου σε θέματα που αφορούν: την τεχνολογία, την καινοτομία, την επιχειρηματικότητα και τον ψηφιακό μετασχηματισμό.