DiaBiz

Korpus Diabiz to konwersacyjny korpus polszczyzny zawierający nagrania oparte na telefonicznych interakcjach pomiędzy klientem i konsultantem oraz ich transkrypcje opatrzone adnotacjami.

Wypróbuj

Jak używać tego narzędzia

1
4036 dialogów call-center o łącznej długości prawie 410 godzin (ponad 3,2 miliona słów) opartych na 251 autentycznych scenariuszach.
2
DiaBiz zawiera dane mówione z 9 domen biznesowych, tj. bankowości, usług energetycznych, telekomunikacji, ubezpieczeń, opieki medycznej, windykacji, turystyki, wynajmu samochodów i handlu detalicznego, z dużym zapotrzebowaniem komercyjnym na analizę konwersacji i rozwiązania automatyzacji.
3
Wszystkie transkrypcje w korpusie są wzbogacone o interpunkcję i kapitalizację. Podzbiór transkrypcji DiaBiz został opatrzony adnotacjami o intencjach klientów i agentów właściwymi dla danej domeny biznesowej.

Cechy narzędzi

Cecha produktu
Dane korpusowe zebrano w okresie od maja 2021 r. do kwietnia 2022 r. Interakcje telefoniczne między 5 agentami z doświadczeniem zawodowym w call center a 191 uczestnikami wcielającymi się w rolę klientów zostały nagrane za pośrednictwem platformy Genesys PureCloud.
Cecha produktu
DiaBiz może służyć jako zbiór danych szkoleniowych i ewaluacyjnych dla różnorodnych zastosowań, takich jak rozpoznawanie mowy i formatowanie transkrypcji, diaryzacja mówców, analiza konwersacyjna, modelowanie systemów dialogowych i wiele innych.
Cecha produktu
Transkrypcje są również opatrzone interpunkcją w celu zwiększenia ich przejrzystości. Zostały one najpierw poddane automatycznej interpunkcji, a następnie ręcznie poprawione, w związku z czym konieczne było opracowanie wytycznych dla interpunkcji, które uwzględniają cechy języka mówionego.
Cecha produktu
Dane korpusowe zostały automatycznie przetranskrybowane i wyrównane czasowo, a następnie ręcznie skorygowane i opatrzone adnotacjami.
Cecha produktu
Korpus został opracowany w celu przyspieszenia rozwoju zewnętrznych silników rozpoznawania mowy, systemów dialogowych i narzędzi inteligencji konwersacyjnej dla języka polskiego.

Już używają

Projekt finansowany w ramach Programu Operacyjnego Inteligentny Rozwój 2014-2020, Priorytet IV: Zwiększenie potencjału naukowo-badawczego, Działanie 4.2: Rozwój nowoczesnej infrastruktury badawczej sektora nauki, nr POIR.04.02.00-00C002/19, „CLARIN – Wspólne zasoby językowe i infrastruktura technologiczna”.

Zobacz projekt