2025.2.4

>ČASOPIS PRO MODERNÍ FILOLOGII 2025 (107) 2

Víceslovné lexikální entity v korpusu i lexikonu

Multiword Lexical Entities in the Corpus and Lexicon

Marie Kopřivová — Hana Skoumalová — Hana Goláňová — Milena Hnátková — Anna Christou — Tomáš Jelínek — Jan Křivan — Vladimír Petkevič — Karla Tvrdá — Přemysl Vítovec — Pavel Vondřička

 

 FULL TEXT   

 ABSTRACT (en)

The aim of the Multiword Units (MWUs) for Digital Education Project is to extend the LEMUR lexicographic database and its software application for corpus annotation, linking the database with language corpora and with the Academic Dictionary of Contemporary Czech. In addition to a significant expansion of the number of MWUs in the database, the focus is on creating a new annotation program that will be able to capture fragments of MWUs and their combinations in Czech texts. As new units are added to the database, modifications and corrections of existing entries are also being made, both in the classification of individual collocations (e.g., proverbs are being revised) and in the database structure (new categories are being added). The first version of the program that will search the corpus and tag MWUs has already been created, replacing the existing FRANTA annotation program. The new description, taking into account several orthogonal axes, will assign a tag to each MWU and its components, providing the user with richer information. In the test run, it will be possible to toggle from corpus to database and from dictionary to database. A didactic manual is also planned, to teach students how to retrieve information about MWUs and work with lexicographic descriptions

 KEYWORDS (cz)

víceslovné lexikální jednotky, databáze LEMUR, Akademický slovník současné češtiny, korpusy češtiny, frazémy

 KEYWORDS (en)

multiword units, MWU database LEMUR, Academic Dictionary of Contemporary Czech, Czech corpora, phrasemes

 DOI

https://doi.org/10.14712/23366591.2025.2.4

 LITERATURE

Baldwin, T. — Kim, S. N. (2010): Multiword expressions. In: N. Indurkhya — F. J. Damerau (eds.), Handbook of Natural Language Processing, 2nd edn. Boca Raton: CRC Press, s. 267–292.

Čermák, F. et al. (1983–2009): Slovník české frazeologie a idiomatiky (SČFI), vol. 1–4. Praha: Academia/Leda.

Čermák, F. (2007): Czech and General Phraseology. Praha: Karolinum.

Gladkova, H. a kol. (2020): Abeceda českých reálií [online]. https://www.abczech.cz/ Cit. 16. 1. 2025.

Hasil, J. (2021): Pár švestiček z vlastní zahrádky pro Hanu Gladkovou, aneb Jsou filmové hlášky součástí frazeologie? In: G. Bakardžieva — M. Giger — K. Lah (eds.), Slovanské a slavistické reflexe. Sborník k životnímu jubileu Hany Gladkové. Červený Kostelec: Pavel Mervart, s. 61–70.

Hasil, J. (2021–2022): Filmové hlášky jako součást české frazeologie a idiomatiky. Český jazyk a literatura, 2, s. 78–84.

Hnátková, M. (2002): Značkování frazémů a idiomů v Českém národním korpusu s pomocí Slovníku české frazeologie a idiomatiky. Slovo a Slovesnost, 63, 2, s. 117–126.

Hnátková, M. — Jelínek, T. — Kopřivová, M. — Petkevič, V. — Rosen, A. — Skoumalová, H. — Vondřička, P. (2018): Lepší vrabec v hrsti nežli holub na střeše. Víceslovné lexikální jednotky v češtině: typologie a slovník. Korpus — gramatika — axiologie, 17, s. 3–22.

Jelínek, T. — Kopřivová M. — Petkevič, V. — Skoumalová, H. (2018): Variabilita českých frazémů v úzu. Časopis pro moderní filologii, 2, s. 151–175.

Kopřivová, M. (2023): A balanced corpus of written language as a basis for compiling a phraseological optimum. In: J. Colson (ed.), Phraseology, constructions and translation. Louvain-la-Neuve: Presses Universitaires de Louvain (Louvain-la-Neuve), s. 301–311. Kopřivová, M. — CHen, Y. (2023): Furt králika! A další filmové hlášky. Jazykovědné aktuality, č. 3–4 /LX, 2023, s. 76–87.

Kopřivová, M. — Šichová, K. (2023): Proverbs in contemporary Czech. Corpus probe into written texts. Jazykovedný časopis, 74, s. 92–99.

Kopřivová, M. (2024): Korpus jako zdroj dat pro frazeologické optimum. In: L. Janovec (ed.), Svět v obrazech a ve frazeologii III. World in Pictures and in Phraseology III. Liberec — Praha: Technická univerzita v Liberci, Univerzita Karlova — Pedagogická fakulta, s. 249–256.

Křen, M. — Cvrček, V. — Hnátková, M. — Jelínek, T. — Kocek, J. — Kováříková, D. — Křivan, J. — Milička, J. — Petkevič, V. — Procházka, P. — Skoumalová, H. — Šindlerová, J. — Škrabal, M.: Korpus SYN, verze 11 ze 14. 12. 2022. Praha: Ústav Českého národního korpusu FF UK 2022. Dostupný z WWW: https://www.korpus.cz.

Křen, M. — Cvrček, V. — Čapka, T. — Hnátková, M. — Jelínek, T. — Kocek, J. — Kováříková, D. — Křivan, J. — Milička, J. — Petkevič, V. — Skoumalová, H. — Šindlerová, J. — Škrabal, M.: Korpus SYN, verze 12 ze 29. 12. 2023. Praha: Ústav Českého národního korpusu FF UK 2023. Dostupný z WWW: https://www.korpus.cz.

Machálek, T. (2020): KonText: Advanced and Flexible Corpus Query Interface. In: Proceedings of the 12th Conference on Language Resources and Evaluation (LREC 2020). Marseille: ELRA, s. 7003–7008.

Petkevič, V. — Kopřivová, M. — Hnátková, M. — Jelínek, T. — Rosen, A.— Skoumalová, H. — Vondřička, P. (2020): Typologie víceslovných jednotek v češtině a frekvenční zastoupení jejich hlavních vlastností v žánrově vyváženém korpusu. Studie z aplikované lingvistiky / Studies in Applied Linguistics, 1, s. 37–62.

Petkevič, V. (2021a): LEMUR — databáze víceslovných lexikálních jednotek: Zpráva o elektronické databázi. Časopis pro moderní filologii, 103, 2, s. 309–314.

Petkevič, V. — Kopřivová, M. — Hnátková, M. — Jelínek, T. — Rosen, A.— Skoumalová, H. — Vondřička, P. (2021b): Databáze víceslovných jednotek v češtině. In: L. Janovec (ed.), Svět v obrazech a ve frazeologii II. World in Pictures and in Phraseology II. Praha: Univerzita Karlova, Pedagogická fakulta, s. 511–528.

Petkevič, V. (2023): Anna T. Litovkina, Hrisztalina Hrisztova-Gotthardt, Péter Barta, Katalin Vargha, Wolfgang Mieder: Anti-Proverbs in Five Languages. Structural Features and Verbal Humor Devices. Časopis pro moderní filologii, 105, 2, s. 295–298.

Skoumalová, H. — Kopřivová, M. — Petkevič, V. — Jelínek, T. — Rosen, A. — Vondřička, P. — Hnátková, M. (2024): LEMUR: A lexicon of Czech multiword expressions. In: V. Giouli — V. Barbu Mititelu (eds.), Multiword expressions in lexical resources: Linguistic, lexicographic, and computational perspectives. Berlin: Language Science Press, s. 1–37.

Šemelík, M. (2024): Neživíš, tak nepřepínej. Neologické filmové a seriálové hlášky pod mikroskopem. In: L. Janovec (ed.), Svět v obrazech a ve frazeologii III. World in Pictures and in Phraseology III. Praha — Liberec: Technická univerzita v Liberci, Univerzita Karlova — Pedagogická fakulta, s. 265–276.

Vondřička, P. (2019): Design of a multiword expressions database. Prague Bulletin of Mathematical Linguistics, 112, s. 83–101.

Úvod > 2025.2.4