Korpuso
El Vikipedio
Korpuso aŭ tekstaro estas aro da tekstoj, kiun oni uzas kiel tuton por studo. Komputado ne necesas, sed tre faciligas la pretigon kaj uzon de tekstaroj. Ankaŭ aro da parolregistraĵoj estas korpuso.
Multaj lingvistoj insistas, ke tekstaro devas esti morfologie markita por ebligi serĉon de gramatikaj formoj en kuntekstoj.
Enhavo |
[redaktu] Celoj
Sama tekstaro povas taŭgi por pluraj celoj. En la tekstoj oni eble serĉos ekzemplojn de vortuzo por vortarfarado por stilesploro, oni eble atentos oftecon de esprimoj por lingvevolua, filologia enketo, aŭ el ne lingvistika vidpunkto, oni rigardos ĝin materialo por historio aŭ socioscienco.
[redaktu] Tipoj
En la preparo de korpuso oni laŭ la ebloj kaj celoj elektas la kvantojn kaj specojn de tekstoj. Kvantojn oni mezuras per vortnombroj. tekstospecojn oni prefere variigas, se la tekstaro estas por ĝenerala lingvesploro: gazetaĵoj, beletraĵoj, sciencaj artikoloj, kompaniaj raportoj, leteroj... male oni striktigas la elekton se la celo specialas: leteroj kaj privataj dokumentoj se oni observas spontanean parolon, politikaj paroladoj kaj komentoj se oni havas ian sociologian celon, samspecaj tekstoj el sinsekvaj epokoj se oni esploras lingvan evoluon...
Simpla kunmeto de dokumentoj ne estas korpuso. Minimume la tesktoj ricevu unu saman komputan strukturon, iliaj lingvo, dato, aŭtoro aŭ deveno estu laŭeble klare kaj unuece indikitaj laŭ bibliografia normo, kaj bazaj esplorrimedoj estu provizitaj: nombradoj, indeksoj, serĉiloj...
Pro tio kaj ankaŭ por faciligi la komparon de rezultoj de esploroj super pluraj tekstaroj, oni provis normi la prezentojn, ordinare surbaze de sgml aŭ xml. La tekstokoda iniciato, mallonge tei, estas tia sufiĉe konata normo komencita en jaro 1988. sed ĝi ne estas la sola.
La lingvistikaj bezonoj ne limiĝas je haveblo de vortoj. ofte lingvistoj bezonas pliajn informojn pri vortklasoj, vortroloj aŭ aliaj gramatikaĵoj, kaj ankaŭ aliaj sciencistoj pli facile studas la temojn de tekstoj se antaŭanalizo estas provizita. Tial oni distingas inter senmarkaj tekstaroj el nudaj dokumentoj nur formate glatigitaj, kaj markhavaj tekstaroj en kiuj vortojn, frazojn aŭ aliajn erojn akompanas kritikaj informoj. La markojn oni ĵargone nomas etikedoj.
[redaktu] Problemoj
Reprezenta tekstaro ne vere ekzistas, ĉar la kvantoj de diverssspecaj tekstoj en la mondo ne estas superrigardebla. Tekstaro necese entenos 0, 10 aŭ 36 elcentojn da gazetaj artikoloj, sed aserti ke en iu lingvo ekzistas tia aŭ tia elcento da gazetaj tekstoj simple sensencas.
Eĉ en tre granda tekstaro, iuj lingvaj fenomenoj maloftas kaj sekve aperas nur en hazardaj kuntekstoj. La sama esploro super diverse grandaj tekstaroj ofte rezultas malsimile. La ĝusta interpreto de tekstaraj esploroj do komence facilas, sed baldaŭ necesigas almenaŭ prudenton, kaj pli bone statistikan kompetenton.
[redaktu] Ekzemploj
Danke al la teĥnika progreso komputaj tekstaroj aperis fine de la 1960-aj jaroj kaj iĝis vaste uzataj en la 1990-aj kun interreta aliro.
Frua epokfara ekzemplo estis la Brown-a korpuso de normala usonangla lingvo, el la fino de la 1960-aj, kiu unua atingis unu milionon da vortoj. Ĝi estas markhava tekstaro kun propra sortimento de lingvosciencaj vortklasaj markoj.
[redaktu] Eksteraj ligiloj
- La esperanta tekstaro: http://bertilow.com/tekstaro (eo)
- Tekstokoda iniciato tei: http://www.tei-c.org (en)
- Interreto uzata kiel tekstaro: http://www.webcorp.org.uk (en)
- Tekstaro de Eckhard Bick (18 mil. vortoj): http://corp.hum.sdu.dk/cqp.eo.html (en)