INF1820: Introduksjon til spra k-og kommunikasjonsteknologi

Størrelse: px
Begynne med side:

Download "INF1820: Introduksjon til spra k-og kommunikasjonsteknologi"

Transkript

1 INF1820: Introduksjon til spra k-og kommunikasjonsteknologi Tredje forelesning Lilja Øvrelid 30 januar, 2014 D ATA I Ra data: uprosesserte tall, tegn, bilder I Kvantitative vs kvalitative data

2 D ATA I Laveste abstraksjonsniva : data informasjon kunnskap V ITENSKAPSTEORI Empiricism is a theory of knowledge which asserts that knowledge comes via the senses experience Rationalism is any view appealing to reason as a source of knowledge or justification (Eng Wikipedia) I Paradigmeskifter lingvistikk og datalingvistikk: I I empirisme rasjonalisme, 60-tallet revitalisering av empiriske metoder 90-tallet I Rasjonalistene: teori-drevet, symbolske metoder I Empiristene: data-drevet, statistiske metoder big data -disiplin

3 SPRÅKLIGE DATA Modellere språklig kunnskap Trenger språklige data Introspeksjon Faktisk språkbruk korpusdata Språkteknologi: programmer som generaliserer over språklige mønstre Korpusdata helt sentralt Menneskelig språkprossessering: hvordan modelleres språk i hjernen? SPRÅK OG HJERNE

4 SPRÅK OG HJERNE Neurolingvistikk lingvistisk fagområde som studerer de mekanismer i den menneskelige hjerne som kontrollerer språk (-forståelse, -produksjon og - tilegnelse) Hjernen: Storehjernen er organisert i lapper : pannelappen, tinninglappen, isselappen, bakhodelappen. Utgjør 80% av hjernen Storehjernen har to halvdeler som arbeider i harmoni med hverandre gjennom corpus collosum (som består av over 200 millioner aktive nerveceller) Kontralateral hjernefunksjon Hvor er språk lokalisert? Data fra atypisk språk, feks ved hjerneskader Afasi enhver type språkvansker etter hjerneskade forskjellige typer avhengig av hvor skaden har oppstått Brocas område Brocas afasi, frontre delen av venstre hjernehalvdel Wernickes område Wernickes afasi, Planum Temporale i venstre hjernehalvdel Språk lateralisert til venstre hjernehalvdel

5 Afasistudier kan også si noe om hvordan språkevnen er organisert i hjernen Brocas afasi: agrammatisk språk, problemer med forståelse av syntaktisk komplekse konstruksjoner Yes... ah... Monday... er... Dad and Peter H... (his own name), and Dad... er... hospital... and ah... Wednesday... Wednesday, nine o clock... and oh... Thursday... ten o clock, ah doctors... two... an doctors... and er... teeth... yah Wernickes afasi: semantisk usammenhengende, men stort sett syntaktisk korrekt I felt worse because I can no longer keep in mind from the mind of the minds to keep me from mind and up to the ear which can be to find among ourselves. Moderne teknologi (MRI, CT, ERP) bekrefter stort sett lateralisering, mer nøyaktig bilde Forandringer i hjerneaktivitet

6 Neurolingvistiske data: hvor språket sitter empirisk støtte for teoretiske hypoteser Informasjon om organisering av språket: modulært organisert separate moduler Ord i nettverk semantisk, uttale table - chair tool - pool Funksjonsord adskilt fra innholdsord (Broca s afasi) Språkets autonomi? Adskilt fra andre kognitive mekanismer Språklige savanter Språkutvikling Kritisk periode for språktilegnelse hos barn Må trigges av miljøet Ville barn, Genie

7 SPRÅKLIGE DATA: KORPUSDATA Et korpus (tekstkorpus) er en strukturert samling tekster Elektronisk lagret Siste 30 årene innenfor lingvistikk og datalingvistikk: empirisk revolusjon Større og større tekstmengder tilgjengelig Empiriske data for lingvistiske studier (motsetning til introspeksjon) Treningsmateriale for datalingvistiske modeller av språklige fenomener

8 SPRÅKLIGE DATA: KORPUSDATA Korpus laget for å representere et visst språk eller språklig variant Språklige data to muligheter: 1. Arkivere alle setninger i et språk: UMULIG 2. Plukke ut et mindre utvalg ( sample ) av språket: MULIG 2 er mulig men ikke trivielt Et korpus må konstrueres slik at det minimerer fordommer ( bias ) og maksimerer representativitet ET TENKT KORPUS FOR NORSK Vi må inkludere forskjellige typer tekster: Skrift og tale? [registere] Fra forskjellige deler av landet? Et utvalg av dialekter? [regionale dialekter] Kun fra 2000-tallet? Hva med 1990? Eller 1950? [tidsperioder] Språk produsert av både menn og kvinner? Alle aldersgrupper, inkludert barn? Hva med utdanningsnivå? Sosial status? [demografi] Skal vi inkludere nyhetsstoff? Hva med kronikker, romaner og e-post? Tegneserier og tekstmeldinger? [sjanger]

9 ET TENKT KORPUS FOR NORSK Svarer JA på alle spørsmålene... men vi må også ta hensyn til fordeling, feks 50% tekst og 50% tale? 20% nyhetsstoff og 15% romaner? etc. Representativt korpus 1. ekstra-lingvistiske faktorer (feks demografi) 15% av innbyggerene bor i Oslo, så vi kan fordele korpuset etter dette 20% av befolkningen er over 60, la oss inkludere 20% av 60+ tekster 2. lingvistisk fordeling 20% av alle norske tekster er romaner 20% av korpuset 20-åringer leser og skriver dobbelt så mye som 60+, dobbelt så mange tekster produsert av/for 20-åringer ET TENKT KORPUS FOR NORSK For (2): Ikke gitt at vi har denne typen informasjon om befolkningen For (1): Ikke tilfredsstillende heller, demografi er ikke en nøyaktig indikator for språkbruk Umulig å oppnå et objektivt representativt korpus. Men vi prøver allikevel...

10 Hva kan vi gjøre med en tekst? Lære noe om teksten Feks typiske fraser i Monty Python and the Holy Grail Amazon bruker dette for anbefalinger av faglitteratur Lære noe om språk generelt Problematisk? Hvor mye kan vi lære om engelsk språk fra finansielle nyheter fra Wall Street Journal? Fra en samling poesi? For å motvirke denne effekten: representative korpuser Brown korpuset: 1 mill ord, tekster fra 500 kilder, kategorisert etter sjanger (nyheter, anmeldelser, religion, hobby etc.)

11 EKSISTERENDE KORPUSER NLTK kommer med flere innebygde korpuser >>> import nltk >>> from nltk.book import * *** Introductory Examples for the NLTK Book *** Loading text1,..., text9 and sent1,..., sent9 Type the name of the text or sentence to view it. Type: texts() or sents() to list the materials. text1: Moby Dick by Herman Melville 1851 text2: Sense and Sensibility by Jane Austen 1811 text3: The Book of Genesis text4: Inaugural Address Corpus text5: Chat Corpus text6: Monty Python and the Holy Grail text7: Wall Street Journal text8: Personals Corpus text9: The Man Who Was Thursday by G. K. Chesterton 1908 EKSISTERENDE KORPUSER Tilgjengelig for nedlasting: Project Gutenberg (Forsøk på) representative korpuser Brown 1M ord British National Corpus (BNC), 100M ord (register, domene, forskjellige tidsperioder, sjanger, demografi osv) American National Corpus, under bygging Større korpuser: Gigaword (nyhetstekster) Google n-gram corpus: 100 GB data unigram (n=1) til fivegram (n=5) frekvens

12 EKSISTERENDE KORPUSER Korpuser for andre språk enn engelsk Arabisk Gigaword Chinese news NoWaC ( Norwegian Web as Corpus ) ca 700 millioner ord web-dokumenter fra.no-domener NoTa-korpuset transkripsjoner av samtaler og intervju fra informanter født og oppvokst i Oslo-området transkribert tekst og tale EKSISTERENDE KORPUSER Parallelle korpuser EUROPARL, OPUS

13 ANNOTERING Korpuser inneholder forskjellige typer informasjon og har gjennomgått forskjellige former for (automatisk/manuell) annotering Delt opp i enheter som tilsvarer et ord, sk tokens: ord, tall, tegnsetting tokenisering I motsetning til type en form uavhengig av individuelle forekomster Hvor mange tokens? Hvor mange typer? The rain stays mainly on the plane Stemming eller lemmatisering: reduksjon til baseform ANNOTERING Korpuser med manuell annotering Mennesker merker opp lingvistisk informasjon Ordklasse (feks Brown) The/at Fulton/np County/np Grand/jj Jury/nn said/vbd Friday/nr an/at investigation/nn... Syntaks (trebanker, feks Penn Treebank) Ordsemantikk, diskursrelasjoner etc. (S (NP (ADJ Happy) (N linguists)) (VP (V make) (NP (Det a) (N diagram))))

14 MANUELT ANNOTERT KORPUS FOR MASKINLÆRING Et korpus med manuelt annotert ordbetydning SKIM the pages for a clearer insight: Reading She SKIMS through the novel which seems to fascinate them: Reading Remove the vanilla pod, SKIM the jam, and let it cool: Removing We SKIMMED across the surface of that sodding lake whilst all around us gathered the dark hosts of hell: Self motion Konstruere en klassifiserer: Tren på Reading, Removing og Self motion instanser Appliser på ny instans: hvilken klasse ligner den mest på? A red grouse SKIMMED low over the heather:??? OPPSUMMERING: SPRÅKLIGE DATA Økende viktighet innenfor LT (korpusdata) Menneskelig språkprosessering afasi-studier måling av hjerneaktivitet Korpusdata representativitet størrelse annotering Utstrakt bruk i språkteknologiske modeller

15 OVERSIKT Såkalt endelig tilstand (finite-state) -teknologi er kjapp og effektiv nyttig for et antall språkteknologiske oppgaver Vi skal se nærmere på: 1. Regulære uttrykk 2. Endelige tilstandsmaskiner ( Finite state automata, FSA) 3. Regulære språk Vil se at regulære uttrykk og endelige tilstandsmaskiner er matematisk ekvivalente, men gir oss forskjellig innfallsvinkel på oppgaver

16 OVERSIKT Perioden rett etter 2 verdenskrig ca 1960: viktig for datalingvistikk Automata-teori basert på Turings arbeid (1936) om algoritmisk beregning Kleene: (1951, 1956): endelige automata og regulære uttrykk. Beviste ekvivalens Chomsky (1956): endelige tilstandsmaskiner som beskrivelser av naturlige språk Formell språkteori: algebra og mengdelære for å definere formelle språk NOEN APPLIKASJONSEKSEMPLER Web-søk Tekstprosessering (finne, erstatte) Finne alle telefonnumre i en tekst, feks: Du kan også ringe Kundeservice på Finne flere tilgrensende instanser av samme ord i en tekst:... vi lurer bare på en en ting Bestemme språket i en setning/tekst: spansk eller polsk? Sytuacja na Bliskim Wschodzie jest napieta, szczegolnie po wczorajszym ataku

17 NOEN APPLIKASJONSEKSEMPLER Validere felter i en database (datoer, e-postadresser, URL er) Søk i et korpus etter lingvistiske mønstre samle statistikk Tildele ordklasse til disse, selv om de ikke fins i ordboken: conurbation, cadence, disproportionality, Thatcherization NOEN APPLIKASJONSEKSEMPLER Utstrakt bruk innenfor: akustisk modellering innenfor talegjenkjenning informasjonshenting ( information extraction ), f.eks. navn på personer og firmaer automatisk morfologisk analyse Disse oppgavene kan løses med endelige tilstandsmaskiner ( finite state automata ) Hvordan kan vi spesifisere slike maskiner?

18 REGULÆRE UTTRYKK Et regulært uttrykk er en beskrivelse av en mengde strenger Brukes til tekstsøk Finnes en rekke UNIX-verktøy (grep, sed), editorer (emacs) og progammeringsspråk (perl, python) som har funksjonalitet for regulære uttrykk Som alle formalismer har ikke regulære uttrykk noe språklig (lingvistisk) innhold, men kan snarere brukes til å referere til lingvistiske enheter

19 REGULÆRE UTTRYKK To slags tegn ( characters ): Bokstavelig ethvert teksttegn er et RU og refererer til seg selv Meta-tegn spesialtegn som lar deg kombinere RU på forskjellige måter Eksempel: /a/ refererer til a /a*/ refererer til ɛ eller a eller aa eller aaa eller... Regulære uttrykk består av: strenger bestående av tegn: /b/, /INF1820/, /informatikk/ Disjunksjon: vanlig disjunksjon: /spise ete/, /penge(r ne)/ tegnklasser:/[dd]en/, /m[ae]nn/, /bec[oa]me/ rekker ( ranges ): [A-Z], [0-9] negasjon: [ˆb] [ˆA-Z0-9]

20 Regulære uttrykk består av (forts.): Tellere opsjonalitet (0 eller 1):? /woodchucks?/ hvilket som helst antall (0 eller flere): Kleenes * /baaa*!/ /[0-9][0-9]*/ Minst en: +: /baa+!/ /[0-9]+ kroner/ wildcard for et hvilket som helst tegn:. /beg.n/ brukes ofte sammen med stjerne: hva som helst : /beltedyr.*beltedyr/ Regulære uttrykk består av (forts.): Ankere: spesielle tegn som forankrer det regulære uttrykket til spesifikt sted i strengen/teksten /ˆDen/ (ˆ - begynnelsen av linjen) /der\.$/ ($ - slutten av linjen)

21 Parenteser grupperer elementer sammen: /rev(ehi)?/ /(herre dame)toalett/ Presedenshierarki: 1. Parentes () 2. Tellere? * + {} 3. Sekvenser og ankere the ˆmy end$ 4. Disjunksjon /juhu */ matcher juhuuuuuuu men ikke juhujuhujuhu Nyttige forkortelser: \d = [0-9] \D = [ˆ0-9] \w = [A-Za-z0-9] \W = [ˆA-Za-z0-9] \s = [ \t\n] \S = [ˆ\s]

22 Et eksempel: Finne alle forekomster av og i en tekst og Problem: Og det ble kveld, og det ble morgen... [Oo]g Problem: Togets rutetider \s[oo]g\s Minimere antall falske positiver (Toget) og falske negativer (Og) T9-systemet: tekst på mobiltelefoner Tekstonymer: ord som korresponderer til samme knappesekvens, feks hole, golf Hvilke andre ord? Bruke regulært uttrykk for å finne ut ˆ[ghi][mno][jlk][def]$ gold, golf, hold, hole,...

23 Substitusjon s/color/colour/ s/versjon\s2\.4/versjon\s2\.5/ s/(versjon\s\d\.)\d/\15/ ELIZA (Weizenbaum 1966): User: Men are all alike ELIZA: IN WHAT WAY? User: They re always bugging us about something ELIZA: CAN YOU THINK OF AN EXAMPLE? User: Well, my boyfriend made me come here ELIZA: User: He says I am depressed much of the time ELIZA: YOUR BOYFRIEND MADE YOU COME HERE. I M SORRY TO HEAR THAT YOU ARE DEPRESSED. s/.* I am (depressed sad).* / I am sorry to hear that you are \1/ s/.* (all always).* / Can you think of a specific example /

24 QUIZ Beskriv strengene som aksepteres av følgende regulære uttrykk /ab+a/ (ab) * ([ˆaeiou][aeiou])\1 \sdis[a-z]+\s

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Fjerde forelesning Lilja Øvrelid 06 februar, 2012 OVERSIKT Finite-state -teknologi er kjapp og effektiv nyttig for et antall språkteknologiske

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Fjerde forelesning Lilja Øvrelid 6 februar, 2017 1 FS-metoder Oversikt Såkalt endelig tilstand (finite-state) -teknologi er kjapp og effektiv

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Tredje forelesning Lilja Øvrelid 30 januar, 2011 DATA Kvalitative eller kvantitative Rådata: uprosesserte tall, tegn, bilder Laveste abstraksjonsnivå:

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Fjerde forelesning Lilja Øvrelid 6 februar, 2017 1 FS-metoder Oversikt Såkalt endelig tilstand (finite-state) -teknologi er kjapp og effektiv

Detaljer

IN1140: Introduksjon til språkteknologi. Forelesning #4

IN1140: Introduksjon til språkteknologi. Forelesning #4 IN1140: Introduksjon til språkteknologi Forelesning #4 Samia Touileb Universitetet i Oslo 13. september 2018 Tema for i dag 2 Regulære uttrykk Endelige tilstandsmaskiner ( Finite State Automata, FSA) Definisjon

Detaljer

INF INF1820. Arne Skjærholt. Terza lezione INF1820. Arne Skjærholt. Terza lezione

INF INF1820. Arne Skjærholt. Terza lezione INF1820. Arne Skjærholt. Terza lezione Arne Skjærholt Terza lezione Arne Skjærholt Terza lezione Regulære uttrykk Regex Regulære uttrykk (regular expressions) er et godt eksempel på det som kalles finite-state methods (hvorfor det heter det

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Tredje forelesning Lilja Øvrelid 30 januar, 2017 1 Språklige data Vitenskapsteori Empiricism is a theory of knowledge which asserts that knowledge

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Tredje forelesning Lilja Øvrelid 30 januar, 2017 1 Språklige data Vitenskapsteori Empiricism is a theory of knowledge which asserts that knowledge

Detaljer

IN1140: Introduksjon til språkteknologi. Forelesning #3

IN1140: Introduksjon til språkteknologi. Forelesning #3 IN1140: Introduksjon til språkteknologi Forelesning #3 Lilja Øvrelid Universitetet i Oslo 06 september 2018 Tema for i dag 2 Språklige data Språk og hjerne Korpusdata Ord: Morfologi Morfemet Orddannelse

Detaljer

INF INF1820. Lectio secunda INF1820. Arne Skjærholt. Lectio secunda

INF INF1820. Lectio secunda INF1820. Arne Skjærholt. Lectio secunda Arne Skjærholt Lectio secunda Arne Skjærholt Lectio secunda Python/NLTK En del grunner til at vi foretrekker Python over Java For det første er NLTK i Python, ikke Java Det er en ganske viktig grunn =)

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Første forelesning Lilja Øvrelid 16 januar, 2017 1 Praktisk Hvor og når Tidspunkt Forelesning: Mandag 12:15-14, Seminarrom Caml Grupper: Onsdager

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Første forelesning Lilja Øvrelid 16 januar, 2017 1 Praktisk Hvor og når Tidspunkt Forelesning: Mandag 12:15-14, Seminarrom Caml Grupper: Onsdager

Detaljer

IN1140: Introduksjon til språkteknologi. Forelesning #2

IN1140: Introduksjon til språkteknologi. Forelesning #2 IN1140: Introduksjon til språkteknologi Forelesning #2 Samia Touileb Universitetet i Oslo 30. august 2018 Tema forrige uke 2 Introduksjon Hva er språkteknologi? Hva er IN1140? Praktiske detaljer Tema for

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Fjerde forelesning Lilja Øvrelid 6 februar, 2014 OVERSIKT Såkalt endelig tilstand (finite-state) -teknologi er kjapp og effektiv nyttig for et

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Fjerde forelesning Lilja Øvrelid 6 februar, 2014 OVERSIKT Såkalt endelig tilstand (finite-state) -teknologi er kjapp og effektiv nyttig for et

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Første forelesning Lilja Øvrelid 16 januar, 2012 Tidspunkt: Mandag 12:15-14, lille aud Onsdag 10:15-12, 12:15-14, Chill Arbeidsmengde: 37,5 /

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Første forelesning Lilja Øvrelid 16 januar, 2014 HVOR OG NÅR Tidspunkt: Forelesning: Torsdag 12:15-14, Seminarrom C Grupper: Mandag/tirsdag 14:15-16

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Første forelesning Lilja Øvrelid 16 januar, 2014 HVOR OG NÅR Tidspunkt: Forelesning: Torsdag 12:15-14, Seminarrom C Grupper: Mandag/tirsdag 14:15-16

Detaljer

INF1820: Oppsummering

INF1820: Oppsummering Arne Skjærholt 8. mai Arne Skjærholt 8. mai Kurset gir en innføring i lingvistisk teori og relaterer denne til språkteknologiske problemområder, metoder og applikasjoner. Fokus er på å koble teori til

Detaljer

IN1140 H2018 gruppeoppgaver Sannsynlighet og språkmodeller

IN1140 H2018 gruppeoppgaver Sannsynlighet og språkmodeller IN1140 H2018 gruppeoppgaver Sannsynlighet og språkmodeller 1 Sannsynlighetsteori 1. I sannsynlighetsteori, hva er: (a) Utfallsrommet (b) Betinget sannsynlighet (c) Hendelse (d) Uavhengige hendelser (e)

Detaljer

INF2080 Logikk og beregninger

INF2080 Logikk og beregninger INF2080 Logikk og beregninger Forelesning 4: Regulære uttrykk Sist oppdatert: 2012-01-24 12:05 4.1 Regulære uttrykk Beskrive aksepterte ord 4.1 Regulære uttrykk Beskrive aksepterte ord INF2080 Logikk og

Detaljer

IN1140 H2019 gruppeoppgaver Språkmodeller og Ordklasser

IN1140 H2019 gruppeoppgaver Språkmodeller og Ordklasser IN1140 H2019 gruppeoppgaver Språkmodeller og Ordklasser 1 NLTK og språkmodeller Målet med denne oppgaven er å programmere to språkmodeller (en unigrammodell og trigrammodell) ved hjelp av Python s Natural

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Lilja Øvrelid 13 april, 2015 LINGVISTISKE NIVÅER SEMANTIKK studiet av betydning slik det uttrykkes gjennom språk betydning til morfemer, ord,

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Ellevte forelesning Lilja Øvrelid 24 april, 2017 1 Semantisk språkteknologi Lingvistiske nivåer 2 Semantikk studiet av betydning slik det uttrykkes

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Ellevte forelesning Lilja Øvrelid 24 april, 2017 1 Semantisk språkteknologi Lingvistiske nivåer 2 Semantikk studiet av betydning slik det uttrykkes

Detaljer

IN1140: Introduksjon til språkteknologi. Forelesning #10

IN1140: Introduksjon til språkteknologi. Forelesning #10 IN1140: Introduksjon til språkteknologi Forelesning #10 Samia Touileb Universitetet i Oslo 01. november 2018 Lingvistiske nivåer 2 Semantikk 3 studiet av betydning slik det uttrykkes gjennom språk betydning

Detaljer

INF2820 Datalingvistikk V2012. Jan Tore Lønning & Stephan Oepen

INF2820 Datalingvistikk V2012. Jan Tore Lønning & Stephan Oepen INF2820 Datalingvistikk V2012 Jan Tore Lønning & Stephan Oepen ENDELIGE TILSTANDSTEKNIKKER OG REGULÆRE UTTRYKK I DATALINGVISTIKK 17. januar 2012 2 Naturlige språk En mann kjøpte en bil av en mann som hadde

Detaljer

INF2820 Datalingvistikk V2017 Forelesning 1.2 Jan Tore Lønning

INF2820 Datalingvistikk V2017 Forelesning 1.2 Jan Tore Lønning INF2820 Datalingvistikk V2017 Forelesning 1.2 Jan Tore Lønning ENDELIGE TILSTANDSMASKINER OG REGULÆRE SPRÅK 19. januar 2017 2 Fysisk modell En tape delt opp i ruter. I hver rute står det et symbol. En

Detaljer

IN1140: Introduksjon til språkteknologi. Forelesning #10

IN1140: Introduksjon til språkteknologi. Forelesning #10 IN1140: Introduksjon til språkteknologi Forelesning #10 Samia Touileb Universitetet i Oslo 01. november 2018 Lingvistiske nivåer 2 Semantikk 3 studiet av betydning slik det uttrykkes gjennom språk betydning

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Sjette forelesning Lilja Øvrelid 27 februar, 2017 1 Sannsynlighet Sannsynlighet spiller en svært viktig rolle i språkteknologi... og også i dette

Detaljer

Han Ola of Han Per: A Norwegian-American Comic Strip/En Norsk-amerikansk tegneserie (Skrifter. Serie B, LXIX)

Han Ola of Han Per: A Norwegian-American Comic Strip/En Norsk-amerikansk tegneserie (Skrifter. Serie B, LXIX) Han Ola of Han Per: A Norwegian-American Comic Strip/En Norsk-amerikansk tegneserie (Skrifter. Serie B, LXIX) Peter J. Rosendahl Click here if your download doesn"t start automatically Han Ola of Han Per:

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Sjette forelesning Lilja Øvrelid 27 februar, 2017 1 Sannsynlighet Sannsynlighet spiller en svært viktig rolle i språkteknologi... og også i dette

Detaljer

INF2820 Datalingvistikk V2014. Jan Tore Lønning

INF2820 Datalingvistikk V2014. Jan Tore Lønning INF2820 Datalingvistikk V2014 Jan Tore Lønning ENDELIGE TILSTANDSTEKNIKKER OG REGULÆRE UTTRYKK I DATALINGVISTIKK 19. januar 2014 2 Naturlige språk En mann kjøpte en bil av en mann som hadde eid bilen i

Detaljer

INF 2820 V2018: Innleveringsoppgave 1

INF 2820 V2018: Innleveringsoppgave 1 INF 2820 V2018: Innleveringsoppgave 1 Besvarelsene skal leveres i devilry innen fredag 9.2 kl 18.00 Det blir 5 sett med innleveringsoppgaver. Hvert sett gir inntil 100 poeng. Til sammen kan en få inntil

Detaljer

1/31/2011 SAMMENHENGER FSA OG REGULÆRE UTTRYKK. Regulære språk. Fra FSA til RE. Fra regulært uttrykk til NFA REGULÆRE UTTRYKK I DATALINGVISTIKK DEL 2

1/31/2011 SAMMENHENGER FSA OG REGULÆRE UTTRYKK. Regulære språk. Fra FSA til RE. Fra regulært uttrykk til NFA REGULÆRE UTTRYKK I DATALINGVISTIKK DEL 2 INF2820 Datalingvistikk V2011 Jan Tore Lønning & Stephan Oepen ENDELIGE TILSTANDSTEKNIKKER OG REGULÆRE UTTRYKK I DATALINGVISTIKK DEL 2 31. januar 2011 2 Regulære språk Følgende er ekvivalente: a) L kan

Detaljer

INF2820 Datalingvistikk V2011. Jan Tore Lønning & Stephan Oepen

INF2820 Datalingvistikk V2011. Jan Tore Lønning & Stephan Oepen INF2820 Datalingvistikk V2011 Jan Tore Lønning & Stephan Oepen ENDELIGE TILSTANDSTEKNIKKER OG REGULÆRE UTTRYKK I DATALINGVISTIKK DEL 2 31. januar 2011 2 SAMMENHENGER FSA OG REGULÆRE UTTRYKK 31. januar

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Andre forelesning Lilja Øvrelid 23 januar, 2012 ...the scientific study of language from a computational perspective. Computational linguists

Detaljer

INF2820 Datalingvistikk V2018 Forelesning 1 del 1, 15. jan. Jan Tore Lønning

INF2820 Datalingvistikk V2018 Forelesning 1 del 1, 15. jan. Jan Tore Lønning INF2820 Datalingvistikk V2018 Forelesning 1 del 1, 15. jan. Jan Tore Lønning INF2820 Datalingvistikk 14. januar 2018 2 I dag: 1. Time: Datalingvistikk: motivasjon og eksempler Praktisk informasjon 2. Time:

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Første forelesning Lilja Øvrelid 17 januar, 2011 Tidspunkt: Mandag 12:15-14, lille aud Onsdag 10:15-12, 12:15-14, Modula OJD Tidspunkt: Mandag

Detaljer

INF2820 Datalingvistikk V2017 Forelesning 2, 23.1 Jan Tore Lønning

INF2820 Datalingvistikk V2017 Forelesning 2, 23.1 Jan Tore Lønning INF2820 Datalingvistikk V2017 Forelesning 2, 23.1 Jan Tore Lønning ENDELIGE TILSTANDSMASKINER OG REGULÆRE SPRÅK, DEL 2 19. januar 2017 2 Sist uke: FSA Brukes om hverandre: Finite state automaton - FSA

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Lilja Øvrelid 13 april, 2015 LINGVISTISKE NIVÅER SEMANTIKK studiet av betydning slik det uttrykkes gjennom språk betydning til morfemer, ord,

Detaljer

INF2820 Datalingvistikk V2012. Jan Tore Lønning

INF2820 Datalingvistikk V2012. Jan Tore Lønning INF2820 Datalingvistikk V2012 Jan Tore Lønning ENDELIGE TILSTANDSTEKNIKKER OG REGULÆRE UTTRYKK I DATALINGVISTIKK DEL 2 20. januar 2012 2 Non-Determinism Speech and Language Processing - Jurafsky and Martin

Detaljer

INF2820 Datalingvistikk V2015. Jan Tore Lønning

INF2820 Datalingvistikk V2015. Jan Tore Lønning INF2820 Datalingvistikk V2015 Jan Tore Lønning ENDELIGE TILSTANDSTEKNIKKER OG REGULÆRE UTTRYKK I DATALINGVISTIKK DEL 2 26. januar 2015 2 ENDELIGE AUTOMATER «FINITE STATE AUTOMATA» (FSA) 26. januar 2015

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Trettende forelesning Lilja Øvrelid 23 april, 2012 SEMANTIKK Studiet av betydning slik det uttrykkes gjennom språk Betydning til morfemer, ord,

Detaljer

INF1820 2013-04-12 INF1820. Arne Skjærholt INF1820. Dagens språk: Russisk. dyes yataya l yektsiya. Arne Skjærholt. десятая лекция

INF1820 2013-04-12 INF1820. Arne Skjærholt INF1820. Dagens språk: Russisk. dyes yataya l yektsiya. Arne Skjærholt. десятая лекция Arne Skjærholt десятая лекция Dagens språk: Russisk. dyes yataya l yektsiya Arne Skjærholt десятая лекция N,Σ,R,S Nå er vi tilbake i de formelle, regelbaserte modellene igjen, og en kontekstfri grammatikk

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Trettende forelesning REPETISJON Lilja Øvrelid 15 mai, 2017 1 Fra emnebeskrivelsen Kurset gir en innføring i lingvistisk teori og relaterer denne

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Trettende forelesning REPETISJON Lilja Øvrelid 15 mai, 2017 1 Fra emnebeskrivelsen Kurset gir en innføring i lingvistisk teori og relaterer denne

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Andre forelesning Lilja Øvrelid 23 januar, 2012 ...the scientific study of language from a computational perspective. Computational linguists

Detaljer

INF2820 Datalingvistikk V2017 Forelesning 1.1, 16.1 Jan Tore Lønning

INF2820 Datalingvistikk V2017 Forelesning 1.1, 16.1 Jan Tore Lønning INF2820 Datalingvistikk V2017 Forelesning 1.1, 16.1 Jan Tore Lønning INF2820 Datalingvistikk 16. januar 2017 2 I dag: 1. Time: Datalingvistikk: motivasjon og eksempler Praktisk informasjon 2. Time: Regulære

Detaljer

INF2820 Datalingvistikk V gang, Jan Tore Lønning

INF2820 Datalingvistikk V gang, Jan Tore Lønning INF2820 Datalingvistikk V2014 13. gang, 10.4.2014 Jan Tore Lønning I dag Introduksjon til semantikk Formell semantikk grunnideene Logikk i NLTK 2 Semantikk Semantikk= studiet av mening Lingvistisk semantikk

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Femtende forelesning REPETISJON Lilja Øvrelid 14 mai, 2011 1 / 68 FRA EMNEBESKRIVELSEN Kurset gir en innføring i lingvistisk teori og relaterer

Detaljer

SAMPOL115 Emneevaluering høsten 2014

SAMPOL115 Emneevaluering høsten 2014 SAMPOL115 Emneevaluering høsten 2014 Om emnet SAMPOL 270 ble avholdt for førsten gang høsten 2013. Det erstatter til dels SAMPOL217 som sist ble avholdt høsten 2012. Denne høsten 2014 var Michael Alvarez

Detaljer

INF2820 Datalingvistikk V2018 Forelesning 3, 29. jan. Jan Tore Lønning

INF2820 Datalingvistikk V2018 Forelesning 3, 29. jan. Jan Tore Lønning INF2820 Datalingvistikk V2018 Forelesning 3, 29. jan. Jan Tore Lønning Hva her vi lært? A. Deterministiske endelige tilstandsmaskiner (DFA) og hvordan de kan definer et (formelt) språk. B. Ikke-deterministiske

Detaljer

Of all the places in the world, I love to stay at Grandma Genia and

Of all the places in the world, I love to stay at Grandma Genia and Of all the places in the world, I love to stay at Grandma Genia and Grandpa Yuda s house. I spend all my vacations there away from my nagging sister, away from my parents without ever having to wake up

Detaljer

INF2820 Datalingvistikk V gang, Jan Tore Lønning

INF2820 Datalingvistikk V gang, Jan Tore Lønning INF2820 Datalingvistikk V2016 13. gang, 20.4.2016 Jan Tore Lønning I dag Introduksjon til semantikk Formell semantikk grunnideene Logikk i NLTK 2 Semantikk Semantikk= studiet av mening Lingvistisk semantikk

Detaljer

ÅRSPLAN I ENGELSK FOR 2. TRINN høst 2014 Læreverk: Stairs

ÅRSPLAN I ENGELSK FOR 2. TRINN høst 2014 Læreverk: Stairs ÅRSPLN I ENGELSK FOR 2. TRINN høst 2014 Læreverk: Stairs U G U S T MÅL (K06) TEM RBEIDSFORM VURDERING Språklæring Muntlig kommuni-kasjon Skriftlig kommunikasjon Kultur, samfunn og litteratur -gi eksempler

Detaljer

INF2820 Datalingvistikk V2016. Jan Tore Lønning

INF2820 Datalingvistikk V2016. Jan Tore Lønning INF2820 Datalingvistikk V2016 Jan Tore Lønning INF2820 Datalingvistikk 20. januar 2016 2 I dag: 1. Time: Datalingvistikk: motivasjon og eksempler Praktisk informasjon 2. Time: Regulære språk OBS: Lov å

Detaljer

Vekeplan 4. Trinn. Måndag Tysdag Onsdag Torsdag Fredag AB CD AB CD AB CD AB CD AB CD. Norsk Matte Symjing Ute Norsk Matte M&H Norsk

Vekeplan 4. Trinn. Måndag Tysdag Onsdag Torsdag Fredag AB CD AB CD AB CD AB CD AB CD. Norsk Matte Symjing Ute Norsk Matte M&H Norsk Vekeplan 4. Trinn Veke 39 40 Namn: Måndag Tysdag Onsdag Torsdag Fredag AB CD AB CD AB CD AB CD AB CD Norsk Engelsk M& Mitt val Engelsk Matte Norsk Matte felles Engelsk M& Mitt val Engelsk Norsk M& Matte

Detaljer

Slope-Intercept Formula

Slope-Intercept Formula LESSON 7 Slope Intercept Formula LESSON 7 Slope-Intercept Formula Here are two new words that describe lines slope and intercept. The slope is given by m (a mountain has slope and starts with m), and intercept

Detaljer

Endelig ikke-røyker for Kvinner! (Norwegian Edition)

Endelig ikke-røyker for Kvinner! (Norwegian Edition) Endelig ikke-røyker for Kvinner! (Norwegian Edition) Allen Carr Click here if your download doesn"t start automatically Endelig ikke-røyker for Kvinner! (Norwegian Edition) Allen Carr Endelig ikke-røyker

Detaljer

Inf1000 (Uke 10) HashMap og ArrayList

Inf1000 (Uke 10) HashMap og ArrayList Inf1000 (Uke 10) HashMap og ArrayList Grunnkurs i programmering Institutt for Informatikk Universitetet i Oslo Anja Bråthen Kristoffersen og Are Magnus Bruaset Bibliotekpakker i Java Det er laget mange

Detaljer

INF2820 Datalingvistikk V2014. Jan Tore Lønning

INF2820 Datalingvistikk V2014. Jan Tore Lønning INF2820 Datalingvistikk V2014 Jan Tore Lønning ENDELIGE TILSTANDSTEKNIKKER OG REGULÆRE UTTRYKK I DATALINGVISTIKK DEL 2 22. januar 2014 2 DFA deterministisk endelig maskin Q = {q0, q1, q2,, qn-1} Strengt

Detaljer

INF2820 Datalingvistikk V2011. Jan Tore Lønning & Stephan Oepen

INF2820 Datalingvistikk V2011. Jan Tore Lønning & Stephan Oepen INF2820 Datalingvistikk V2011 Jan Tore Lønning & Stephan Oepen ENDELIGE TILSTANDSTEKNIKKER OG REGULÆRE UTTRYKK I DATALINGVISTIKK 26. januar 2011 2 Naturlige språk En mann kjøpte en bil av en mann som hadde

Detaljer

INF2820 Datalingvistikk V2016. Jan Tore Lønning

INF2820 Datalingvistikk V2016. Jan Tore Lønning INF2820 Datalingvistikk V2016 Jan Tore Lønning ENDELIGE AUTOMATER «FINITE STATE AUTOMATA» (FSA) 25. januar 2016 2 Fysisk modell En tape delt opp i ruter. I hver rute står det et symbol. En innretning som

Detaljer

INF2820 Datalingvistikk V2016. Jan Tore Lønning

INF2820 Datalingvistikk V2016. Jan Tore Lønning INF2820 Datalingvistikk V2016 Jan Tore Lønning ENDELIGE AUTOMATER «FINITE STATE AUTOMATA» (FSA) 3. februar 2016 2 Fysisk modell En tape delt opp i ruter. I hver rute står det et symbol. En innretning som

Detaljer

IN1140: Introduksjon til språkteknologi. Forelesning #12

IN1140: Introduksjon til språkteknologi. Forelesning #12 IN1140: Introduksjon til språkteknologi Forelesning #12 Lilja Øvrelid Universitetet i Oslo 15 november 2018 Tema for i dag 2 I dag Repetisjon Digital prøveeksamen Neste uke Gjennomgang av eksamensoppgave

Detaljer

BIBSYS Brukermøte 2011 Live Rasmussen og Andreas Christensen. Alt på et brett? -om pensum på ipad og lesebrett

BIBSYS Brukermøte 2011 Live Rasmussen og Andreas Christensen. Alt på et brett? -om pensum på ipad og lesebrett BIBSYS Brukermøte 2011 Live Rasmussen og Andreas Christensen Alt på et brett? -om pensum på ipad og lesebrett Prosjektet epensum på lesebrett Vi ønsker å: Studere bruk av digitalt pensum i studiesituasjonen.

Detaljer

Følger Sipsers bok tett både i stoff og oppgaver.

Følger Sipsers bok tett både i stoff og oppgaver. 1 - hrj 1 Følger Sipsers bok tett både i stoff og oppgaver. Tirsdag forelesninger, nytt stoff Onsdag eksempler og utfyllende stoff Torsdag oppgaver fra uka før Start: kapittel 1 (2uker), 2 (2uker),3 (2uker),4

Detaljer

The internet of Health

The internet of Health The internet of Health! Biler, helse og fremtiden!! Velkon 2014, 22. October 2014 Nard Schreurs, IKT-Norge Få ut begrepet «pasient» av tanker om helse. Aldring 1980-2010 Menn 72 år til 79 år Kvinner 79

Detaljer

GEO326 Geografiske perspektiv på mat

GEO326 Geografiske perspektiv på mat U N I V E R S I T E T E T I B E R G E N Institutt for geografi Emnerapport høsten 2015: GEO326 Geografiske perspektiv på mat Innhold: 1. Informasjon om emnet 2. Statistikk 3. Egenevaluering 4. Studentevaluering

Detaljer

Oppgave 1 (samlet 15%)

Oppgave 1 (samlet 15%) 2 Du kan svare på norsk, dansk, svensk eller engelsk. Du skal svare på alle spørsmålene. Vekten på de ulike spørsmålene er oppgitt. Du bør lese gjennom hele settet slik at du kan stille spørsmål til faglærerne

Detaljer

INF2820 Datalingvistikk V2014. Jan Tore Lønning

INF2820 Datalingvistikk V2014. Jan Tore Lønning INF2820 Datalingvistikk V2014 Jan Tore Lønning INF2820 Datalingvistikk 19. januar 2014 2 I dag: 1. Time: Datalingvistikk: motivasjon og eksempler Praktisk informasjon 2. Time: Endelige tilstandsteknikker

Detaljer

1/18/2011. Forelesninger. I dag: Obligatoriske oppgaver. Gruppeundervisning. Jan Tore Lønning & Stephan Oepen

1/18/2011. Forelesninger. I dag: Obligatoriske oppgaver. Gruppeundervisning. Jan Tore Lønning & Stephan Oepen INF2820 Datalingvistikk V2011 Jan Tore Lønning & Stephan Oepen til INF2820 Datalingvistikk Ole Johan Dahls hus 18. januar 2011 2 I dag: 0 Praktisk informasjon OBS: Lov å stille spørsmål underveis Forelesninger

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Andre forelesning Lilja Øvrelid 23 januar, 2017 1 Språkteknologi Språkteknologi Kjært barn: Språkteknologi ( Language Technology ) Datalingvistikk

Detaljer

Tema. Informasjonsarkitektur Brukervennlighet/Usability Kommunikasjon som treffer målrettet kommunikasjon

Tema. Informasjonsarkitektur Brukervennlighet/Usability Kommunikasjon som treffer målrettet kommunikasjon Tema Informasjonsarkitektur Brukervennlighet/Usability Kommunikasjon som treffer målrettet kommunikasjon Ooops, sorry. I puked all over your web site. h"p://www.dokimos.org/ajff/ Unnskyld meg, men hva

Detaljer

Linux-programmer som bruker regulæruttrykk: grep, sed, awk

Linux-programmer som bruker regulæruttrykk: grep, sed, awk Linux-programmer som bruker regulæruttrykk: grep, sed, awk grep * søking i tekstlige data grep [OPTIONS] REGEX [FILE...] Verktøy som finnes i alle Unix-lignende OS Leser en eller flere tekstfiler, eller

Detaljer

lytte etter og bruke engelske språklyder gjennom praktiskestetiske gi eksempler på noen situasjoner der det kan være nyttig å kunne engelsk

lytte etter og bruke engelske språklyder gjennom praktiskestetiske gi eksempler på noen situasjoner der det kan være nyttig å kunne engelsk Årsplan i for 2.trinn 2014-2015 Faglærer Yngve Henriksen Læreverk: Stairs 2 Kompetansemål etter 2.årstrinn Ulike tema, delmål og arbeidsformer brukes på veien mot kompetansemålene fra K06 Språklæring Muntlig

Detaljer

INF1820 V2014 Oppgave 3b CFGer og semantikk

INF1820 V2014 Oppgave 3b CFGer og semantikk INF1820 V2014 Oppgave 3b CFGer og semantikk Innleveringsfrist fredag 9. mai Lever inn svarene dine i en fil som angir brukernavnet ditt, slik: oblig3b brukernavn.py En perfekt besvarelse av denne oppgaven

Detaljer

3/8/2011. I dag. Dynamic Programming. Example. Example FORMELLE EGENSKAPER VED SPRÅK (KAP. 16) Jan Tore Lønning & Stephan Oepen

3/8/2011. I dag. Dynamic Programming. Example. Example FORMELLE EGENSKAPER VED SPRÅK (KAP. 16) Jan Tore Lønning & Stephan Oepen INF2820 Datalingvistikk V2011 Jan Tore Lønning & Stephan Oepen CHARTPARSING (SEKSJ 13.4) FORMELLE EGENSKAPER VED SPRÅK (KAP. 16) 8. mars 2011 2 I dag Oppsummering fra sist: Dynamisk programmering CKY-algoritmen

Detaljer

INF2820 Datalingvistikk V Gang, del Jan Tore Lønning

INF2820 Datalingvistikk V Gang, del Jan Tore Lønning INF2820 Datalingvistikk V2018 10. Gang, del 2 19.3 Jan Tore Lønning TEKSTKLASSIFISERING 2 I dag: tekstklassifisering Tekstklassifisering og maskinlæring Eksempel: NLTK "Names" Ekseperimentelt oppsett 1

Detaljer

Engelsk gruppe 2 høsten 2015

Engelsk gruppe 2 høsten 2015 Engelsk gruppe 2 høsten 2015 I løpet av høsten har vi jobbet med disse tingene på engelsk: Tall - numbers Norsk - Norwegian Engelsk - English Mitt språk -My language 1 en one 2 to two 3 tre three 4 fire

Detaljer

GEO231 Teorier om migrasjon og utvikling

GEO231 Teorier om migrasjon og utvikling U N I V E R S I T E T E T I B E R G E N Institutt for geografi Emnerapport høsten 2013: GEO231 Teorier om migrasjon og utvikling Innhold: 1. Informasjon om emnet 2. Statistikk 3. Egenevaluering 4. Studentevaluering

Detaljer

prøver i veke 39. Her vil ein kunne korleis elevane presterer i lesefart- og forståing, diktat av enkeltord og setningar og alfabetet.

prøver i veke 39. Her vil ein kunne korleis elevane presterer i lesefart- og forståing, diktat av enkeltord og setningar og alfabetet. Vekeplan 10. klasse Namn:.. Veke 38-39 Norsk: Tverrfagleg prosjekt: Samliv Samarbeide godt i grupper. Lage veggavis. Presentere eit gruppearbeid. Gjere eit rollespel. Det vil vere to timar med kartleggings-

Detaljer

INF1820: Introduksjon til språk-og kommunikasjonsteknologi

INF1820: Introduksjon til språk-og kommunikasjonsteknologi INF1820: Introduksjon til språk-og kommunikasjonsteknologi Andre forelesning Lilja Øvrelid 23 januar, 2017 1 Språkteknologi Språkteknologi Kjært barn: Språkteknologi ( Language Technology ) Datalingvistikk

Detaljer

INF 2820 V2018: Innleveringsoppgave 1 - løsningsforslag

INF 2820 V2018: Innleveringsoppgave 1 - løsningsforslag INF 2820 V2018: Innleveringsoppgave 1 - løsningsforslag Oppgave 1: Endelige tilstandsmaskiner (20 poeng) Denne oppgaven kan gjøres i JFLAP. Du anbefales likevel å løse den med papir og penn først for å

Detaljer

INF2820 Datalingvistikk V2015. Jan Tore Lønning

INF2820 Datalingvistikk V2015. Jan Tore Lønning INF2820 Datalingvistikk V2015 Jan Tore Lønning INF2820 Datalingvistikk 21. januar 2015 2 I dag: 1. Time: Datalingvistikk: motivasjon og eksempler Praktisk informasjon 2. Time: Endelige tilstandsteknikker

Detaljer

INF2820 Datalingvistikk V2011. Jan Tore Lønning & Stephan Oepen

INF2820 Datalingvistikk V2011. Jan Tore Lønning & Stephan Oepen INF2820 Datalingvistikk V2011 Jan Tore Lønning & Stephan Oepen CHARTPARSING (SEKSJ 13.4) FORMELLE EGENSKAPER VED SPRÅK (KAP. 16) 8. mars 2011 2 I dag Oppsummering fra sist: Dynamisk programmering CKY-algoritmen

Detaljer

INF2820 Datalingvistikk V2011. Jan Tore Lønning & Stephan Oepen

INF2820 Datalingvistikk V2011. Jan Tore Lønning & Stephan Oepen INF2820 Datalingvistikk V2011 Jan Tore Lønning & Stephan Oepen til INF2820 Datalingvistikk Ole Johan Dahls hus 18. januar 2011 2 I dag: 0 Praktisk informasjon 1. Hvorfor datalingvistikk? 2. Hva er utfordringene?

Detaljer

EN Skriving for kommunikasjon og tenkning

EN Skriving for kommunikasjon og tenkning EN-435 1 Skriving for kommunikasjon og tenkning Oppgaver Oppgavetype Vurdering 1 EN-435 16/12-15 Introduction Flervalg Automatisk poengsum 2 EN-435 16/12-15 Task 1 Skriveoppgave Manuell poengsum 3 EN-435

Detaljer

KROPPEN LEDER STRØM. Sett en finger på hvert av kontaktpunktene på modellen. Da får du et lydsignal.

KROPPEN LEDER STRØM. Sett en finger på hvert av kontaktpunktene på modellen. Da får du et lydsignal. KROPPEN LEDER STRØM Sett en finger på hvert av kontaktpunktene på modellen. Da får du et lydsignal. Hva forteller dette signalet? Gå flere sammen. Ta hverandre i hendene, og la de to ytterste personene

Detaljer

Bestille trykk av doktoravhandling Ordering printing of PhD Thesis

Bestille trykk av doktoravhandling Ordering printing of PhD Thesis Bestille trykk av doktoravhandling Ordering printing of PhD Thesis Brukermanual / User manual Skipnes Kommunikasjon ntnu.skipnes.no PhD Thesis NTNU LOG IN NOR: Gå inn på siden ntnu.skipnes-wtp.no, eller

Detaljer

INF2820 Datalingvistikk V2015. Jan Tore Lønning

INF2820 Datalingvistikk V2015. Jan Tore Lønning INF2820 Datalingvistikk V2015 Jan Tore Lønning ENDELIGE TILSTANDSTEKNIKKER OG REGULÆRE UTTRYKK I DATALINGVISTIKK DEL 2 22. januar 2015 2 ENDELIGE AUTOMATER «FINITE STATE AUTOMATA» (FSA) 23. januar 2015

Detaljer

PATIENCE TÅLMODIGHET. Is the ability to wait for something. Det trenger vi når vi må vente på noe

PATIENCE TÅLMODIGHET. Is the ability to wait for something. Det trenger vi når vi må vente på noe CARING OMSORG Is when we show that we care about others by our actions or our words Det er når vi viser at vi bryr oss om andre med det vi sier eller gjør PATIENCE TÅLMODIGHET Is the ability to wait for

Detaljer

FORBEREDELSE TIL ÅRSPRØVE I ENGELSK 7. KLASSE FREDAG 19. MAI 2017

FORBEREDELSE TIL ÅRSPRØVE I ENGELSK 7. KLASSE FREDAG 19. MAI 2017 FORBEREDELSE TIL ÅRSPRØVE I ENGELSK 7. KLASSE FREDAG 19. MAI 2017 Prøve består av følgende deler: Lyttetekst: Svar på spørsmål med fullstendige setninger Lesetekst: Les teksten og svar på spørsmålene med

Detaljer

INF2820 Datalingvistikk V Gang Jan Tore Lønning

INF2820 Datalingvistikk V Gang Jan Tore Lønning INF2820 Datalingvistikk V2015 5. Gang - 16.2 Jan Tore Lønning I dag Kontekstfrie grammatikker, avledninger og trær (delvis repetisjon) Kontekstfrie grammatikker og regulære språk Kontekstfrie grammatikker

Detaljer

Assignment. Consequences. assignment 2. Consequences fabulous fantasy. Kunnskapsløftets Mål Eleven skal kunne

Assignment. Consequences. assignment 2. Consequences fabulous fantasy. Kunnskapsløftets Mål Eleven skal kunne Consequences Kunnskapsløftets Mål Eleven skal kunne KRL Filosofi og etikk reflektere over filosofiske temaer knyttet til identitet og livstolkning, natur og kultur, liv og død, rett og galt. gjøre rede

Detaljer

INF1820 V2013 Oppgave 3b CFGer og semantikk

INF1820 V2013 Oppgave 3b CFGer og semantikk INF1820 V2013 Oppgave 3b CFGer og semantikk Innleveringsfrist, onsdag 1. mai Lever inn svarene dine i en fil som angir brukernavnet ditt, slik: oblig3a brukernavn.py En perfekt besvarelse på denne oppgaven

Detaljer

LF - Eksamen i INF1820

LF - Eksamen i INF1820 LF - Eksamen i INF820 INF820 Eksamen vår 207 Hjelpemidler Ingen. Flervalgsoppgaver I oppgave og 6 får man 5 poeng for riktig svar og 0 poeng for galt svar. I oppgave 0 får du 2 poeng for hvert riktig svar

Detaljer

Informasjonsgjenfinning

Informasjonsgjenfinning INF5820 H2008 Institutt for Informatikk Universitetet i Oslo 18. september Outline 1 Hva er IR? Tradisjonell evaluering Invertert indeks 2 Rangering Evaluering av rangering 3 Grunnleggende egenskaper Vektorer

Detaljer