{"id":1771,"date":"2017-11-30T08:11:55","date_gmt":"2017-11-30T07:11:55","guid":{"rendered":"http:\/\/blog.mozilla.org\/press-pl\/?p=1771"},"modified":"2017-11-30T08:27:57","modified_gmt":"2017-11-30T07:27:57","slug":"common-voice-mozilla-udostepnia-drugi-co-do-wielkosci-zbior-danych-glosowych","status":"publish","type":"post","link":"https:\/\/blog.mozilla.org\/press-pl\/2017\/11\/30\/common-voice-mozilla-udostepnia-drugi-co-do-wielkosci-zbior-danych-glosowych\/","title":{"rendered":"Common Voice \u2013 Mozilla udost\u0119pnia drugi co do wielko\u015bci zbi\u00f3r danych g\u0142osowych"},"content":{"rendered":"<p>Od startu inicjatywy Common Voice zebrali\u015bmy setki tysi\u0119cy pr\u00f3bek g\u0142osu za po\u015brednictwem naszej <a href=\"http:\/\/voice.mozilla.org\/\">strony internetowej<\/a> i <a href=\"https:\/\/itunes.apple.com\/us\/app\/project-common-voice-by-mozilla\/id1240588326?mt=8\">aplikacji iOS<\/a>. Dzi\u015b <a href=\"https:\/\/creativecommons.org\/choose\/zero\/\">udost\u0119pniamy<\/a> pierwsz\u0105 wersj\u0119 tej kolekcji g\u0142os\u00f3w.<\/p>\n<p>Od pocz\u0105tku Mozilla opiera\u0142a si\u0119 na kreatywno\u015bci, wsp\u00f3\u0142czuciu i zaradno\u015bci ludzi na ca\u0142ym \u015bwiecie, kt\u00f3rzy pomagali nam budowa\u0107 i promowa\u0107 sie\u0107 jako globalne zasoby publiczne dost\u0119pne dla wszystkich. Stanowi\u0142o to podstaw\u0119 naszej eksperymentalnej pracy w dziedzinie <a href=\"https:\/\/research.mozilla.org\/machine-learning\/\">system\u00f3w ucz\u0105cych si\u0119 i rozpoznawania mowy<\/a> oraz budowania obszernej bazy wysokiej jako\u015bci danych g\u0142osowych za pomoc\u0105 Common Voice.<\/p>\n<p>Zbi\u00f3r ten zawiera blisko 400 000 nagra\u0144 od 20 000 r\u00f3\u017cnych os\u00f3b, co daje oko\u0142o 500 godzin wypowiedzi. Do tej pory jest to drugi co do wielko\u015bci og\u00f3lnodost\u0119pny zestaw danych g\u0142osowych, o kt\u00f3rym wiemy, a ludzie na ca\u0142ym \u015bwiecie ca\u0142y czas dodaj\u0105 i sprawdzaj\u0105 nowe pr\u00f3bki!<\/p>\n<p>Mo\u017cesz <a href=\"https:\/\/voice.mozilla.org\/data\">pobra\u0107 dane<\/a> ju\u017c teraz!<\/p>\n<p><a href=\"http:\/\/blog.mozilla.org\/press-pl\/2017\/11\/30\/common-voice-mozilla-udostepnia-drugi-co-do-wielkosci-zbior-danych-glosowych\/commonvoicedownload\/\" rel=\"attachment wp-att-1772\"><img decoding=\"async\" loading=\"lazy\" class=\"aligncenter size-large wp-image-1772\" src=\"https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceDownload-600x275.png\" alt=\"\" width=\"600\" height=\"275\" srcset=\"https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceDownload-600x275.png 600w, https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceDownload-252x115.png 252w, https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceDownload-768x352.png 768w, https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceDownload.png 1363w\" sizes=\"(max-width: 600px) 100vw, 600px\" \/><\/a><\/p>\n<p>Sami przekonali\u015bmy si\u0119 jak trudno jest znale\u017a\u0107 publicznie dost\u0119pne dane do naszej pracy w zakresie technologii mowy, dlatego udost\u0119pniamy linki do wszystkich innych znanych nam \u017ar\u00f3de\u0142. Chcemy dalej rozwija\u0107 nasz\u0105 stron\u0119 tak, aby sta\u0142a si\u0119 centraln\u0105 baz\u0105 danych g\u0142osowych.<\/p>\n<p>Patrz\u0105c na dzisiejszy ekosystem g\u0142osu, widzimy wielu programist\u00f3w, tw\u00f3rc\u00f3w, start-upowc\u00f3w i badaczy, kt\u00f3rzy chc\u0105 eksperymentowa\u0107 i budowa\u0107 technologie g\u0142osowe. Wi\u0119kszo\u015b\u0107 z nas ma jednak dost\u0119p jedynie do do\u015b\u0107 ograniczonego zbioru danych g\u0142osowych. Jest to niezb\u0119dny element tworzenia wysokiej jako\u015bci silnik\u00f3w rozpoznawania mowy. Te dane g\u0142osowe mog\u0105 kosztowa\u0107 dziesi\u0105tki tysi\u0119cy dolar\u00f3w, a ich skala jest niewystarczaj\u0105ca do opracowania rozwi\u0105za\u0144 w zakresie rozpoznawania mowy na poziomie oczekiwanym przez ludzi. Dostarczaj\u0105c ten nowy zbi\u00f3r danych publicznych, chcemy pom\u00f3c przezwyci\u0119\u017cy\u0107 te bariery i u\u0142atwi\u0107 tworzenie nowych, lepszych system\u00f3w rozpoznawania mowy (takich jak nasza w\u0142asna funkcja <a href=\"https:\/\/github.com\/mozilla\/DeepSpeech\">Deep Speech<\/a>). Zacz\u0119li\u015bmy od j\u0119zyka angielskiego, ale wkr\u00f3tce b\u0119dziemy wspiera\u0107 ka\u017cdy j\u0119zyk. Mamy nadziej\u0119, \u017ce dzi\u0119ki naszej r\u00f3wnoleg\u0142ej pracy nad mechanizmem speech-to-text, uda nam si\u0119 udost\u0119pni\u0107 technologi\u0119 mowy wi\u0119kszej liczbie os\u00f3b, kt\u00f3re b\u0119d\u0105 mog\u0142y wprowadza\u0107 innowacje i konkurowa\u0107 z wi\u0119kszymi graczami.<\/p>\n<p>Czy jeste\u015b zainteresowany naszym og\u00f3lnodost\u0119pnym projektem rozpoznawania mowy \u201eDeep Speech\u201d oraz wykorzystaniem zasob\u00f3w Common Voice do tworzenia lepszych produkt\u00f3w?\u00a0 Reuben Morais z zespo\u0142u Mozilla Machine Learning w\u0142a\u015bnie opublikowa\u0142 artyku\u0142 pt. \u201e<a href=\"https:\/\/hacks.mozilla.org\/2017\/11\/a-journey-to-10-word-error-rate\/\">Journey to &lt;10% Word Error Rate<\/a>\u201d. Stanowi on ciekawe podsumowanie wyzwa\u0144 i wniosk\u00f3w zebranych podczas pracy nad stworzeniem pierwszego modelu mechanizmu rozpoznawania mowy open source, kt\u00f3ry zosta\u0142 dzi\u015b opublikowany w <a href=\"http:\/\/github.com\/mozilla\/DeepSpeech\">repozytorium github<\/a>!<\/p>\n<p>W dalszym ci\u0105gu przyjmujemy ch\u0119tnych do pracy nad projektem Common Voice. Prosimy o przesy\u0142anie pomys\u0142\u00f3w jak mo\u017cemy wsp\u00f3\u0142pracowa\u0107, tak aby\u015bmy wiedzieli, w jaki spos\u00f3b korzystacie z danych. Czekamy r\u00f3wnie\u017c na sugestie, w jaki spos\u00f3b ten projekt mo\u017ce by\u0107 jeszcze bardziej przydatny.<\/p>\n<p><a href=\"http:\/\/blog.mozilla.org\/press-pl\/2017\/11\/30\/common-voice-mozilla-udostepnia-drugi-co-do-wielkosci-zbior-danych-glosowych\/commonvoiceapp2\/\" rel=\"attachment wp-att-1773\"><img decoding=\"async\" loading=\"lazy\" class=\"aligncenter size-large wp-image-1773\" src=\"https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceApp2-600x403.jpg\" alt=\"\" width=\"600\" height=\"403\" srcset=\"https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceApp2-600x403.jpg 600w, https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceApp2-252x169.jpg 252w, https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceApp2-768x516.jpg 768w, https:\/\/blog.mozilla.org\/press-pl\/files\/2017\/11\/CommonVoiceApp2.jpg 1943w\" sizes=\"(max-width: 600px) 100vw, 600px\" \/><\/a><\/p>\n<p>Chcieliby\u015bmy podzi\u0119kowa\u0107 Mycroft, SNIPS, Bangor University, LibriSpeech, VoxForge, TED-LIUM, Tatoeba.org, Mythic, SAP oraz wszystkim <a href=\"https:\/\/github.com\/mozilla\/voice-web\/graphs\/contributors\">wsp\u00f3\u0142tw\u00f3rcom z github<\/a>. Nie uda\u0142oby nam si\u0119 bez Was!<\/p>\n<p><em>Stale d\u0105\u017cymy do poprawy jako\u015bci naszego zbioru danych. Wejd\u017a na <a href=\"http:\/\/voice.mozilla.org\/\">stron\u0119 internetow\u0105 Common Voice<\/a> i pom\u00f3\u017c nam zweryfikowa\u0107 nagrania, co jest r\u00f3wnie wa\u017cne jak przekazywanie g\u0142osu!<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Od startu inicjatywy Common Voice zebrali\u015bmy setki tysi\u0119cy pr\u00f3bek g\u0142osu za po\u015brednictwem naszej strony internetowej i aplikacji iOS. Dzi\u015b udost\u0119pniamy pierwsz\u0105 wersj\u0119 tej kolekcji g\u0142os\u00f3w. Od pocz\u0105tku Mozilla opiera\u0142a si\u0119 &hellip; <a class=\"go\" href=\"https:\/\/blog.mozilla.org\/press-pl\/2017\/11\/30\/common-voice-mozilla-udostepnia-drugi-co-do-wielkosci-zbior-danych-glosowych\/\">Czytaj wi\u0119cej<\/a><\/p>\n","protected":false},"author":494,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[66],"tags":[],"_links":{"self":[{"href":"https:\/\/blog.mozilla.org\/press-pl\/wp-json\/wp\/v2\/posts\/1771"}],"collection":[{"href":"https:\/\/blog.mozilla.org\/press-pl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/blog.mozilla.org\/press-pl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/blog.mozilla.org\/press-pl\/wp-json\/wp\/v2\/users\/494"}],"replies":[{"embeddable":true,"href":"https:\/\/blog.mozilla.org\/press-pl\/wp-json\/wp\/v2\/comments?post=1771"}],"version-history":[{"count":0,"href":"https:\/\/blog.mozilla.org\/press-pl\/wp-json\/wp\/v2\/posts\/1771\/revisions"}],"wp:attachment":[{"href":"https:\/\/blog.mozilla.org\/press-pl\/wp-json\/wp\/v2\/media?parent=1771"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/blog.mozilla.org\/press-pl\/wp-json\/wp\/v2\/categories?post=1771"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/blog.mozilla.org\/press-pl\/wp-json\/wp\/v2\/tags?post=1771"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}