Eleições de 2024 em Portugal tiveram recolhas especiais no Arquivo.pt

Outubro 9, 2024Agosto 31, 2024 por Ricardo Basílio

Última atualização em 9 de Outubro de 2024 às 17:33

O Arquivo.pt fez recolhas especiais sobre as três eleições que se realizaram este ano: as Legislativas de 10 de março, as eleições na Madeira de 26 de maio e as Europeias de 9 de junho.

Foram identificadas mais de 70 mil páginas com conteúdos relacionados com as eleições e a vida política em Portugal e na Europa e recolhidos cerca de 4 Terabytes de informação.

Agradece-se às pessoas que contribuiram com a seleção de endereços. Desafia-se os professores e estudantes a fazerem trabalhos que utilizem as coleções especiais sobre as eleições que o Arquivo.pt tem feito ao longo dos anos.

Saiba mais detalhes sobre o procedimento da recolha e sobre os resultados obtidos.

Eleições Legislativas 2024

As Eleições Legislativas tiveram lugar no dia 10 de março de 2024 para eleger os membros da Assembleia da República para a 16.ª Legislatura da Terceira República Portuguesa.

Destacamos nesta recolha o contributo da comunidade com uma seleção manual de 827 páginas, o que contribuiu para melhorar a qualidade da coleção.

Utilizou-se cerca de 500 termos compostos ou palavras-chave para procurar conteúdos publicados na Web acerca das eleições. O serviço utilizado para pesquisa automática foi o Bing Search API. Os resultados foram limitados ao top 20.

Por exemplo, o termo composto “frente-a-frente legislativas 2024″ encontrou páginas relativas aos debates entre candidatos. O termo “habitação legislativas 2024″ obteve páginas relativas às propostas partidárias para a habitação. O termo “legislativas 2024 site:expresso.pt” identificou páginas do Expresso sobre as eleições. Foram utilizados também os nomes dos candidatos.

Após as eleições foram usados termos de pesquisa próprios para esse período, tais como “vitória legislativas 2024”, “derrota legislativas 2024” ou “resultados legislativas 2024”, entre outros.

A pesquisa automática no Bing Search API resultou em 34.120 endereços obtidos antes das eleições e em 5.803 após as eleições.

Os sites dos partidos políticos, incluindo os partidos sem assento parlamentar, também foram recolhidos durante o período eleitoral.

Nem todos os conteúdos identificados puderam ser efetivamente gravados, devido às limitações das ferramentas de gravação e às restrições dos próprios sites.

Para a gravação foram utilizadas as ferramentas Heritrix, Brozzler e Browsertrix-cloud (versão beta) cortesia do Webrecorder.net.

A gravação realizou-se entre 6 e 20 de março e resultou em 3.2 Terabytes de informação. Os conteúdos foram incluídos na coleção espeacial EAWP45 e estarão disponíveis passado 1 ano.

Para saber mais, consulte o conjunto de dados:

Lista de termos de pesquisa
Resultados da pesquisa automática antes das eleições
Resultados da pesquisa automática depois das eleições
Lista de endereços identificadas de forma manual pela comunidade
Sites dos partidos políticos
Collection ID: EAWP45 (onde se encontram os conteúdos gravados, disponíveis passado 1 ano)

Eleições para a Assembleia Legislativa da Madeira 2024

As Eleições para a Assembleia Legislativa da Madeira realizaram-se a 26 de maio. O Arquivo.pt fez uma recolha especial de conteúdos publicados na Web.

Começou-se por fazer uma pesquisa automática por notícias, páginas eleitorais e websites relacionados com as eleições na Madeira. Utilizou-se uma lista termos de pesquisa para colocar no Bing Search API.

Pretendeu-se obter o maior número possível endereços de páginas (URLs) relacionados com o evento ou tema em causa, ou seja, as eleições madeirenses. Para isso definiu-se vários limites para os resultados: top 10, top 20, top 50 e top 100. Deixou-se documentado esse processo, o qual mostra que quanto mais alargamos o número de resultados maior é o número de páginas pouco relevantes e por vezes fora do alvo pretendido.

A totalidade dos endereços (12.656) foi colocada a gravar no dia 7 de junho no Heritrix crawler.

Saiba mais consultando o conjunto de dados:

Termos de pesquisa
Lista de endereços obtidos no dia das eleições
Lista de endereços obtidos depois das eleições
Lista final de endereços únicos
Collection ID: EAWP46 (onde se encontram os conteúdos gravados, disponível passado 1 ano)

Eleições Europeias 2024 em recolha multilingue

As Eleições Europeias realizaram-se a 9 de junho em Portugal. Em alguns países, como por exemplo, a Estónia, a Chéquia ou a Itália as eleições foram em outras datas.

O Arquivo.pt recolheu páginas relativas às Eleições Europeias nos 27 países da União Europeia e nas 24 línguas oficiais.

Para isso seguiu-se a mesma metodologia usada para a coleção acerca das Eleições Europeias de 2019, ou seja, uma pesquisa multilingue e semiautomática.

Utilizou-se uma lista de 40 termos compostos que foram traduzidos para as 24 línguas oficiais da UE. A tradução dos termos para as diversas línguas foi feita em 2019 pelo pelo EU Publications Office. Dessa colaboração resultou uma lista multilingue com 960 de termos para colocar no Bing Search API.

Antes das eleições, a 3 de junho, foi realizada a primeira pesquisa da qual resultaram 8.986 endereços únicos, com o número de resultado limitado ao top 20.

Depois das eleições, adicionou-se novos termos de pesquisa com os nomes dos principais candidadatos ao Parlamento Europeu em cada país da União Europeia. Desta segunda pesquisa pós-eleitoral foram obtidos 15.371 endereços únicos.

A ferramenta utilizada para esta recolha foi o Heritrix. A recolha foi limitada a três “saltos” (“hops”). O crawler seguiu ligações, neste caso, até três vezes. Quer isto dizer que se optou por uma certa contenção na profundidade da gravação. Três “saltos” ou “hops” no Heritrix crawler é o suficiente para a recolha de uma página (em outras aplicações também denominada por gravação “page” ou “single page”).

Os conteúdos foram gravados entre 7 e 20 de junho e incluídos na recolha especial EAWP46. Estará disponível passado 1 ano.

Saiba mais consultando o conjunto de dados:

Lista multilingue de termos de pesquisa
Resultados da pesquisa automática antes das eleições
Resultados da pesquisa automática depois das eleições
Collection ID: EAWP46 (onde se encontram os conteúdos gravados, disponível passado 1 ano)

Saiba mais sobre as recolhas eleitorais de anos anteriores

Dados abertos para Processamento da Linguagem Natural

Dezembro 13, 2024Setembro 18, 2023 por admin

Daniel Gomes e Diego Alves apresentando no evento final do CLEÓPATRA.

Última atualização em 13 de Dezembro de 2024 às 13:56

Arquivo.pt preservou documentos online em várias línguas sobre as Eleições Parlamentares Europeias de 2019

As Eleições Parlamentares Europeias de 2019 foram um evento de relevância internacional. A estratégia para preservar a informação relevante na World Wide Web é delegada às instituições nacionais. No entanto, a preservação de páginas web que documentam eventos internacionais ainda não foi oficialmente atribuída.

A equipa do Arquivo.pt, com o objetivo de preservar o conteúdo online multilingue que documenta este evento, aplicou uma combinação de processos humanos e automáticos de seleção.

O processo de geração da coleção sobre as Eleições Parlamentares Europeias de 2019 foi realizado em duas etapas.

Na primeira etapa, foram identificados 40 termos relevantes em português sobre as Eleições Parlamentares Europeias de 2019, que foram posteriormente traduzidos automaticamente para as 24 línguas oficiais da União Europeia: búlgaro, croata, checo, dinamarquês, holandês, inglês, estónio, finlandês, francês, alemão, grego, húngaro, irlandês, italiano, letão, lituano, maltês, polaco, português, romeno, eslovaco, esloveno, espanhol e sueco.

Estas traduções foram revistas em colaboração com o Publications Office of the European Union. Além disso, paralelamente, foi lançada uma lista colaborativa para reunir contribuições de endereços relevantes oriundos da comunidade internacional.

Na segunda etapa, a equipa do Arquivo.pt executou iterativamente 6 recolhas (99 milhões de ficheiros web, 4,8 TB) utilizando diferentes configurações e software de recolha, para maximizar a qualidade do conteúdo recolhido.

Os dados web obtidos foram agregados numa coleção especial identificada como EAWP23 e tornaram-se pesquisáveis e acessíveis através do Arquivo.pt em julho de 2020 (https://arquivo.pt/ee2019).

Projeto CLEOPATRA: Cross-lingual Event-centric Open Analytics Research Academy

Daniel Gomes e Diego Alves se apresentando no evento final do CLEÓPATRA — Daniel Gomes e Diego Alves apresentando no evento final do CLEÓPATRA.

A CLEOPATRA ITN foi uma Rede de Formação Inovadora Marie Skłodowska-Curie destinada a gerar formas de compreender melhor a cobertura digital massiva de grandes eventos na Europa durante as últimas décadas.

O principal objetivo era facilitar o processamento avançado multilíngue em grande escala de informações textuais e visuais acerca dos principais eventos contemporâneos e desenvolver métodos inovadores para acesso e interação eficientes com informações multilíngue.

No total, 14 pesquisadores em estágio inicial hospedados em 9 universidades europeias desenvolveram suas pesquisas enquanto estavam matriculados como estudantes de doutoramento.

Parceiros associados como o Arquivo.pt contribuíram para o CLEOPATRA acolhendo e formando investigadores em início de carreira como Diego Alves. No âmbito do programa de formação, este investigador realizou um estágio no Arquivo.pt em Lisboa de junho a agosto de 2022.

A ideia era desenvolver parte da sua investigação sobre estruturas sintáticas das línguas da UE utilizando os recursos textuais preservados pelo Arquivo.pt e trocar conhecimentos com os especialistas em preservação da web sobre estratégias de extração e processamento de dados históricos da web.

Diego Alves defendeu a sua tese de doutoramento intitulada Computational typological analysis of syntactic structures in European languages em julho de 2023 na Faculdade de Ciências Humanas e Sociais da Universidade de Zagreb (Croácia).

Gerando conjuntos de dados textuais para processamento de linguagem natural

O trabalho de Diego Alves originou conjuntos de dados multilíngues sobre as Eleições Parlamentares Europeias de 2019 que constituem recursos preciosos para investigação científica.

Este trabalho será detalhado no capítulo “Robustness of Corpus-based Typological Strategies for Dependency Parsing” do livro de acesso aberto CLEOPATRA intitulado “Event Analytics across Languages and Communities”.

Um fluxo de Processamento de Linguagem Natural em 3 etapas foi desenvolvido para gerar conjuntos de dados textuais que podem ser usados em diversos tipos de estudos na área de Humanidades Digitais:

Extrair texto: O conteúdo textual foi extraído de cada URL arquivado usando a biblioteca Python newspaper3k. O idioma de cada texto extraído foi determinado usando a biblioteca langdetect e os textos escritos em diferentes línguas foram armazenados em ficheiros distintos;
Limpar textos extraídos: um script Python foi aplicado para limpar os textos removendo informações desnecessárias (ex.: instâncias repetidas, linhas vazias, etc.);
Dupla verificação de identificação de língua: a língua de cada texto extraído e limpo foi verificada novamente para eliminar possíveis erros originados durante as etapas anteriores.

Dois novos conjuntos de dados para investigação em acesso-aberto!

Um dos resultados obtidos foi um conjunto de dados contendo textos agrupados por língua disponível publicamente. Cada ficheiro contém os textos numa determinada língua sobre as Eleições da União Europeia de 2019. A distribuição dos textos extraídos para cada língua está descrita na figura abaixo:

Número de tokens de cada corpus extraídos da coleção Eleições da União Europeia 2019 preservados pelo Arquivo.pt (EAWP23).

O referido corpus foi anotado automaticamente quanto às relações gramaticais e de dependência para gerar um corpus com informações sintáticas úteis para estudos linguísticos.

Foi aplicado o modelo multilíngue da ferramenta UDify (Kondratyuk e Straka, 2019).

Os textos anotados seguiram a mesma ordem dos respetivos ficheiros de texto originais. Cada frase foi anotada seguindo a Universal Dependencies framework no formato CoNNL-U, que é a referência em termos de anotação sintática em Processamento de Linguagem Natural. Assim, cada ficheiro deste conjunto de dados contém os textos anotados numa determinada língua sobre as Eleições da União Europeia de 2019.

Os textos anotados sintaticamente sobre as Eleições Europeias de 2019 estão disponíveis ao público!

Saber mais

Robustness of Corpus-Based Typological Strategies for Dependency Parsing, Event Analytics across Languages and Communities, 2024
Secondments@Arquivo.pt e novas ferramentas de investigação disponíveis e Robustness of Corpus based Typological Strategies for Dependency Parsing” , apresentação no evento final do CLEOPATRA, 2023
Conjunto de dados de textos limpos e com língua verificada sobre as eleições europeias de 2019 (textos brutos)
Conjunto de dados de textos anotados sintaticamente sobre as Eleições Europeias de 2019 (textos CoNLL-U)
Script Python para extrair textos de línguas específicas do Arquivo.pt através de uma lista de palavras-chave
Análise tipológica computacional de estruturas sintáticas em línguas europeias, Tese de doutorado de Diego Alves, 2023
Diego Alves personal page
API do Arquivo.pt
Robustness of Corpus-based Typological Strategies for Dependency Parsing, Diego Alves and Daniel Gomes, Event Analytics across Languages and Communities book, Springer.

Coleção do 1º arquivo da web europeu pesquisável no Arquivo.pt

Agosto 9, 2024Junho 4, 2021 por Ricardo Basílio

Última atualização em 9 de Agosto de 2024 às 16:16

A coleção histórica de conteúdos da Web gerada ao longo da atividade da Internet Memory Foundation (IMF) foi doada ao Arquivo.pt e pode agora ser pesquisada!

A IMF foi uma organização europeia dedicada a preservar conteúdos da web que foi extinta em 2018.

O 1º projeto de arquivo da Web na Europa (2004-2010) foi liderado por Julien Masanès (que foi convidado de honra na celebração dos 10 anos do Arquivo.pt) e denominava-se European Archive Foundation.

Em 2010, Julien Masanès, o “pai” dos arquivos da Web na Europa criou a IMF.

Exemplos de páginas da coleção doada pelo IMF

A coleção doada pelo IMF foi agora integrada no acervo do Arquivo.pt para ser preservada para a posteridade.

Esta coleção é composta por 142 milhões de ficheiros que totalizam 6,3 TB de informação histórica cujos textos ou imagens podem agora ser pesquisados através do Arquivo.pt.

Página do projeto LIMES (Land and Sea Monitoring for Environment and Security), 2009.

Página do projeto Intelligence-territoriale, 2009.

Página sobre as Eleições Europeias de 2009 (www.elections2009-results.eu).

Página da agência noticiosa Reuters acerda do WikiLeaks, 2011

Página do Internet Memory Foundation, 2014.

Pesquise esta nova coleção!

Esta nova coleção recebeu foi nomeada “InternetMemory” na lista de coleções do Arquivo.pt.

Podem ser realizadas pesquisas sobre esta coleção utilizando o parâmetro de pesquisa collection ou através da página de pesquisa customizada disponível em arquivo.pt/InternetMemory.

Coleção internacional acerca das Eleições Europeias 2019 está disponível

Agosto 30, 2022Setembro 4, 2020 por Ricardo Basílio

Última atualização em 30 de Agosto de 2022 às 10:45

Excerto de www.european.elections.eu, preservado pelo Arquivo.pt em maio de 2019

A coleção especial de páginas Web acerca das Eleições Europeias de 2019 está disponível para pesquisa no Arquivo.pt.

Para compilar esta coleção, foram identificadas páginas escritas em 24 línguas europeias, através de pesquisas automáticas no motor de busca Bing e sugestões oriundas de 17 países europeus.

Destaca-se a colaboração do Publications Office of the European Union que reviu a lista dos termos de pesquisa nas diversas línguas da União Europeia.

Entre maio e julho de 2019, o Arquivo.pt recolheu de forma exaustiva páginas relacionadas com as Eleições Europeias em vários países.

A coleção resultante denominada “Eleições Europeias 2019” reúne 99 milhões de ficheiros que totalizam 4,8 TeraBytes de informação.

O relatório técnico “A transnational crawl of the European Parliamentary Elections 2019” detalha a metodologia aplicada. Esta metodologia tem sido aplicada para gerar outras coleções temáticas como por exemplo acerca do Covid-19.

Convidam-se todos os cidadãos, especialmente os investigadores, a explorarem os conteúdos da Web do passado e a incluí-los nos seus trabalhos através deste serviço criado especialmente para pesquisar a coleção multi-lingue Eleições Europeias de 2019: https://arquivo.pt/ee2019

Vídeo “A transnational and cross-lingual crawl of the European Parliamentary Elections 2019”

A transnational and cross-lingual crawl of the European Parliamentary Elections 2019, Ivo Branco, IIPC Web Archiving Conference and RESAW 2021 (slides)

Para saber mais

Eleições Europeias de 2019: precisamos da sua ajuda!

Outubro 1, 2021Maio 14, 2019 por Ricardo Basílio

Última atualização em 1 de Outubro de 2021 às 9:11

Os sites e as páginas sobre as eleições desaparecem rapidamente depois do período eleitoral, deixando para a história um vazio de informação.

A responsabilidade de preservar a memória é de todos e, por isso, precisamos da sua ajuda para identificar páginas Web relacionadas com as eleições, tal como fizemos em anos anteriores, para que as ideias e os debates deste tempo sobre o futuro da Europa não caiam no esquecimento.

Basta acrescentar na lista colaborativa os endereços de páginas ou de sites que acha interessantes para memória futura destas eleições, através do link seguinte:

Eleições Europeias 2019: lista colaborativa (https://tinyurl.com/memoriaeuropa2019)

Ao sugerir 1 endereço prestará um valioso contributo. Consegue ajudar?

Se tiver alguma questão, por favor contacte-nos.

Arquivo.pt preservou sites sobre projetos de Investigação & Desenvolvimento financiados pela Comissão Europeia

Outubro 1, 2021Abril 10, 2017 por admin

Última atualização em 1 de Outubro de 2021 às 9:12

O Arquivo.pt identificou automaticamente sites de projetos de I&D para preservar o seu conteúdo. Já preservou mais de 52 milhões de ficheiros (7 TB) relacionados com ciência para acesso futuro.

Os sites de I&D são valiosos e estão a ser perdidos

Os sites dos projetos de Investigação & Desenvolvimento (I&D) são cada vez mais usados para disponibilizar importante informação científica que complementa a literatura publicada (ex. conjuntos de dados ou documentação, software). Contudo, após o término dos projetos, os sites normalmente desaparecem causando uma perda permanente de informação científica única e valiosa.

Distribuição de URLs de projetos que referenciavam conteúdo relevante por Programa-Quadro desde o FP4 (1994), oriundos do EU Open Data Portal e validados em novembro de 2015.

A informação online relativa a projetos de I&D não está a ser exaustivamente documentada. Por exemplo, a informação referente aos endereços dos sites dos projetos financiados no programa 7º Programa-Quadro (FP7) disponibilizada através do Portal de Dados Abertos da União Europeia (EU Open Data Portal) está omissa para 92% dos projetos.

Arquivo.pt identificou sites de I&D automaticamente

O foco do Arquivo.pt é a preservação de informação publicada na Web para fins científicos e académicos. Assim sendo, desenvolveu um projeto para a identificação automática de endereços relacionados com projetos de I&D para que o seu conteúdo seja preservado de forma sistemática.

A identificação automática é realizada através da combinação de conjuntos de dados abertos com serviços de busca gratuitos, de modo a que possa ser aplicada mesmo em contextos com recursos limitados. Este trabalho está detalhado num artigo publicado na conferência científica International Conference on Digital Preservation 2016.

Todos os dados e ferramentas desenvolvidas durante esta investigação foram disponibilizados em acesso aberto de modo a que possam ser reutilizados e colaborativamente melhorados.

Já foram preservados 52 milhões de ficheiros da web relacionados com Ciência

A aplicação da metodologia desenvolvida pelo Arquivo.pt já permitiu preservar mais de 52 milhões de ficheiros (7 TB) oriundos de 53 993 sites de projetos de I&D financiados desde o FP4 (1994), tais como o projeto europeu WEZARD financiado com o objetivo de “preparar a futura comunidade de investigação na área da robustez dos sistemas de transporte aéreos quando for deparada com incidentes climáticos”. O site para este projeto (www.wezard.eu) já não se encontra disponível online.Contudo, foi preservado e pode ser acedido no Arquivo.pt.

Todos os sites identificados e preservados no âmbito deste projeto podem ser acedidos através do Arquivo.pt desde março de 2017.

Site do projeto europeu WEZARD (www.wezard.eu), financiado pelo 7º Programa-Quadro da União Europeia entre 2011 e 2013, disponível no Arquivo.pt.

Contributos para complementar os dados do European Open Data Portal

O processo desenvolvido foi aplicado aos conjuntos de dados publicados através do EU Open Data Portal para tentar complementar as informações em falta acerca dos URLs dos projetos. Os resultados obtidos mostraram que a integridade do conjunto de dados do FP7 foi melhorada em 86,6%.

Todos os conjuntos de dados resultantes foram disponibilizados ao público para que possam ser melhorados e reutilizados por outras organizações interessadas na preservação deste património digital (FP4, FP5, FP6, FP7).

Referências

Unavailability of online supplementary scientific information from articles published in major journals, the FASEB journal 2005
The Case for the Preservation of R&D Project Websites, InternationaI Internet Preservation Blog 2016
Preserving Websites Of Research & Development Projects, International Conference on Digital Preservation 2016 (ppt, bibtex)
Software e conjuntos de dados experimentais para identificar automaticamente sites de I&D
Bases de dados do European Open Data Portal completadas pelo Arquivo.pt através da metodologia desenvolvida. Os novos URLs de projeto estão disponíveis na coluna “Identified Websites” dos ficheiros: FP4, FP5, FP6, FP7.

É investigador?

Sugira os seus sites para serem preservados

Uma primeira tentativa de arquivar o .EU.

Outubro 1, 2021Agosto 13, 2015 por admin

Última atualização em 1 de Outubro de 2021 às 9:12

Notícia actualizada em Agosto 1, 2019

O Arquivo.pt realizou uma experiência para tentar preservar sítios alojados sob o domínio .EU.

O domínio .EU é utilizado frequentemente para referenciar sítios web relacionados com a Europa. A estratégia de preservação da Web tem sido delegar a responsabilidade de arquivar cada domínio nacional às entidades nacionais respetivas. Contudo, o domínio .EU é internacional e a sua preservação ainda não foi atribuída a nenhuma instituição.

O RESAW (Research Infrastructure for the Study of Archived Web Materials) é uma rede europeia que tem como objetivo a criação de uma infraestrutura para o estudo de materiais arquivados da web.

No âmbito das atividades do RESAW, o Arquivo.pt realizou uma primeira tentativa de recolher e arquivar sítios alojados sob o domínio .EU. Esta primeira recolha decorreu entre os dias 21 de Novembro e 16 de Dezembro de 2014.

Foram realizadas mais 2 recolhas experimentais de sites do .EU que passado 1 ano passaram a estar pesquisáveis em Arquivo.pt. Além disso, disponibilizámos um protótipo de pesquisa focada nas recolhas do .EU que demonstra a facilidade de criar motores de busca focados em determinadas colecções através da utilização do operador de pesquisa “collection”

Colaborações com investigadores interessados em estudar os materiais recolhidos são bem-vindas.