http://www.cnr.it/ontology/cnr/individuo/descrizionemodulo-descrizionemodulo/ID9293
Descrizione del modulo "Metodi, risorse e strumenti per lo studio della storia della tradizione e per la critica del testo (IC.P02.002.005)"
- Type
- Label
- Descrizione del modulo "Metodi, risorse e strumenti per lo studio della storia della tradizione e per la critica del testo (IC.P02.002.005)" (literal)
- Potenziale impiego per bisogni individuali e collettivi
- Le comunità scientifiche di riferimento dei vari progetti che insistono sul presente modulo sono costituite da epigrafisti, filologi, filosofi, storici e linguisti che operano in ambienti collaborativi, tramite piattaforme web che forniscono adeguati strumenti di analisi e annotazione del testo.
Più nello specifico, l'interesse degli storici, filosofi e filologi cui le risorse e gli strumenti creati in seno a Greek into Arabic sono rivolti è focalizzato sullo studio della trasmissione del sapere fra civiltà differenti, con lingue diverse.
La comunità delle scienze umane cui si indirizzano le risorse e gli strumenti creati in seno a Memorata Poetis focalizza il proprio interesse sullo studio dell'intertestualità fra testi letterari ed epigrafici, quindi concepiti in contesti pragmatici diversi, in epoche differenti e in lingue che spaziano dal Greco al Latino, dall'Arabo all'Italiano.
Infine, la comunità degli sviluppatori di software per il dominio degli studi filologici concentra il proprio interesse sulla riusabilità e l'estendibilità dei componenti software open source, organizzati in librerie, messi a disposizione per nuovi progetti. (literal)
- Tematiche di ricerca
- Le principali tematiche di ricerca del modulo sono incentrate sull'elaborazione di metodi e la creazione di strumenti per lo studio della trasmissione di testi antichi multilingui. Seguendo il work-flow che inizia con l'acquisizione del documento digitale e termina con l'annotazione linguistica, stilistica, storico-filologica da parte degli esperti di dominio in ambienti collaborativi, le tematiche specifiche si articolano nel seguente modo:
a) raccolta e strutturazione formale di dati su fonti primarie reali;
b) sviluppo di strumenti open source per l'acquisizione di testi antichi e del vicino oriente tramite OCR. La ricerca riguarda il miglioramento dell'accuratezza dell'OCR e l'implementazione di strumenti per la correzione manuale dei risultati;
c) fruizione multimodale di testi multilingui in parallelo, sia per la ricerca testuale che per l'annotazione congiunta;
d) lemmatizzazione di testi greci, latini e arabi;
e) annotazione di temi e motivi in epigrammi letterari e in testi epigrafici (alcuni dei quali mappati sul modello 2D o 3D del relativo supporto epigrafico);
f) sviluppo di risorse semantico-lessicali per l'associazione sull'asse paradigmatico di termini multilingui. (literal)
- Competenze
- Il gruppo di ricerca possiede le competenze necessarie per la realizzazione degli obiettivi, in quanto è composto da: un ricercatore a tempo indeterminato esperto in filologia classica e linguistica computazionale; un'assegnista madre lingua araba esperta in linguistica computazionale; un'assegnista di madre lingua francese esperta in epigrafia digitale; un assegnista esperto in logica temporale e modale, nonché in computer science; un tecnico esperto programmatore e sistemista;
Mantiene la responsabilità scientifica del Greek into Arabic l'ex direttore esperto in filologia computazionale e collabora al progetto un'associata esperta in lessicografia computazionale.
In stretta collaborazione con altri moduli della commessa, il gruppo si avvale del supporto di un operatore tecnico a tempo indeterminato per la correzione dell'OCR; di un dottorando di ricerca in ingegneria informatica che cura la progettazione e lo sviluppo di moduli software per le piattaforme web; di un tecnico a tempo determinato per lo sviluppo di risorse computazionali per l'annotazione linguistica e l'estrazione lessicale e di un tecnologo a tempo determinato per lo sviluppo di interfacce web. (literal)
- Potenziale impiego per processi produttivi
- Il miglioramento dell'accuratezza dell'OCR applicato a lingue antiche e del Vicino Oriente ha un grande impatto sui processi produttivi nell'ambito dell'editoria digitale, perché permette di evitare la digitazione manuale del testo e consente di ridurre notevolmente i costi di correzione dell'OCR.
Il sistema, già in avanzato stato di sviluppo per il Greco antico, grazie anche alle collaborazioni internazionali con il Perseus Project e i suoi partners, è pensato per fornire strumenti di acquisizione del testo e di proof-reading professionale a terzi, costituiti sia da enti pubblici (Università, Enti di ricerca, etc.), sia da ditte private (aziende di data entry, etc.).
L'implementazione di un motore morfologico dell'Arabo permette di fornire uno strumento di analisi dai molteplici impieghi, che può essere applicato per il controllo e il miglioramento dell'OCR, grazie alla creazione di liste di forme flesse ammissibili, per lo spell-checking di documenti di nuova creazione, per l'analisi morfologica funzionale a successivi livelli di analisi (sintattica, semantica, etc.).
Lo sviluppo di risorse semantico-lessicali multilingui migliora i sistemi di traduzione automatica. (literal)
- Tecnologie
- Le metodologie di modellazione e di intervento su oggetti e sistemi, si articolano nel modo seguente:
a) modellazione dati da fonti primarie;
b) modellazione di un sistema dinamico per l'aumento progressivo dell'accuratezza dell'OCR tramite selezione dei training set migliori per il testo da riconoscere e selezione dei risultati migliori dell'OCR di ciascuna OCR engine coinvolto nel processo, nonché modellazione di un sistema di scoring dei suggerimenti forniti allo spell-checker per le correzioni automatiche;
c) modellazione in UML delle classi e delle interazioni fra classi organizzate in una libreria di componenti software per la gestione di testi in parallelo con varianti e molteplici livelli di annotazione;
d) potenziamento delle tecnologie già adottate per la lemmatizzazione del Greco, del Latino e dell'Arabo, tramite catene markoviane ed estensione di dizionari e filtri sintattici e semantici;
e) modellazione in OWL delle ontologie necessarie all'annotazione semantica di temi e motivi;
f) estrazione, tramite il parser generator ANTLR, di informazioni strutturate da documenti semistrutturati, quali lessici monolingui e bilingui e testi allineati in pericopi. (literal)
- Obiettivi
- La ricerca intende:
a) modellare enti e fenomeni del dominio filologico e delle scienze dell'antichità:
a.1) le informazioni provenienti dalla fonte primaria (le relazioni fra testo, scrittura e modelli 2D/3D della fonte e le relazioni fra testo e contesto storico-linguistico)
a.2) le informazioni riguardanti lo studio della tradizione del testo (modellazione della variantistica, modellazione delle molteplici interpretazioni al testo presenti nella letteratura secondaria)
b) creare componenti software open source organizzati in librerie per:
b.1) migliorare l'accuratezza dell'OCR su testi greci, latini e arabi;
b.2) gestire, in modo centralizzato, il proof-reading dei risultati dell'OCR;
b.3) trattare archivi digitali di testi multilingui, afferenti agli ambiti della poesia epigrammatica, della storia della scienza e del pensiero filosofico;
b.4) produrre indici e concordanze contrastive;
b.5) produrre un sistema di interrogazione con un'interfaccia utente adeguata alle esigenze delle comunità scientifiche di riferimento;
b.6) produrre risorse linguistiche per lo studio del Greco antico, del Latino e dell'Arabo;
c) disseminare i risultati con finalità scientifiche e divulgative. (literal)
- Stato dell'arte
- - Per l'OCR applicato al Greco antico, B. Robertson (Mount Allison University, Canada - http://heml.mta.ca/rigaudon) sta ottenendo risultati promettenti, per la digitalizzazione su larga scala di edizioni critiche. Occorre migliorare il riconoscimento del layout, l'accuratezza dell'OCR sull'apparato critico e l'allineamento con differenti output forniti da altri OCR engine.
- Il Greek and Arabic Lexicon fondato da G. Endress fornisce uno standard di riferimento per lo studio delle traduzioni greco-arabe di opere filosofiche e scientifiche, tuttavia copre una porzione ridotta dell'intero lessico, quindi occorre uno strumento informatico di analisi bilingue funzionale all'estensione di un lessico di dominio.
- Morpheus, (Perseus Project) per il Greco, LEMLAT (ILC) per il Latino, Alkhalil Morphological Analyzer e AraMorph, con aggiornamento lessicale e filtri realizzati presso l'ILC, per l'Arabo costituiscono lo stato dell'arte nell'ambito dell'analisi morfologica delle lingue in oggetto.
- Il Perseus Project, l'Alpheios Project, Musisque Deoque, Wittgenstein Source Project e Van Gogh Letters Project rappresentano lo stato dell'arte circa la fruizione delle risorse testuali. (literal)
- Tecniche di indagine
- Le tecniche di indagine si articolano nel modo seguente:
a) raccolta di dati su fonti reali e elaborazione formale delle loro interpretazioni linguistiche.
b) allineamento dei risultati forniti da diversi OCR engine; aggregazione di informazioni da diverse edizioni della stessa opera e dagli spell-checker;
c) pericopatura dinamica di testi in parallelo, sia tramite tecniche di allineamento automatico di testi bilingui, sia tramite tecniche di selezione manuale dei confini delle pericopi; progettazione di una struttura robusta per la gestione del versionamento sia dei testi da stabilire, sia delle annotazioni che insistono su tali testi;
d) tecniche di POS-tagging basate su catene markoviane per il miglioramento della lemmatizzazione automatica; tecniche di filtering sintattico e semantico per limitare la sovraproduzione di ipotesi di analisi fornite dai motori morfologici (in particolare dell'Arabo);
e) ristrutturazione in ontologie delle tassonomie adottate per l'annotazione di temi e motivi;
f) estrazione di informazioni strutturate da lessici bilingui. (literal)
- Descrizione di
Incoming links:
- Descrizione