Para promover ainda mais a utilização do acervo do Arquivo.pt no contexto do ensino e da investigação ou no contexto profissional, três parceiros do prémio criaram menções honrosas com um prémio associado.
O jornal Público atribuirá uma Menção Honrosa para os trabalhos realizados com base nos conteúdos do Público online guardados no Arquivo.pt.
O Aveiro Media Competence Center (AMCC) atribuirá uma Menção Honrosa ao melhor trabalho sobre o arquivo da web de um ou vários media online portugueses.
A Associação DNS.PT atribuirá uma Menção Honrosa a um professor que tenha incentivado a submissão de trabalhos.
Partilhe e divulgue
Ajude-nos a divulgar o Prémio Arquivo.pt 2024 por potenciais candidatos.
Última atualização em 27 de Março de 2024 às 11:16
Mais de 100 websites históricos da Faculdade de Ciências da Universidade de Lisboa (FCUL) passaram a estar acessíveis através do serviço Memorial do Arquivo.pt.
O Departamento de Informática da FCUL enviou ao Arquivo.pt uma lista de websites antigos alojados nos seus servidores que já não eram atualizados, mas cujo conteúdo histórico continua a ser interessante para a comunidade (ex. websites de projetos de investigação ou eventos científicos).
O Arquivo.pt preservou estes websites em colaboração com os seus responsáveis, procurando manter para o futuro uma representação fiel dos conteúdos publicados.
A FCUL redirecionou o endereço de cada website para o Arquivo.pt, e pôde então desligar os servidores respetivos e passar a poupar os recursos que dispendia na sua manutenção (ex. eletricidade, espaço, recursos humanos).
O website do programa científico MiNEMA foi o primeiro que a FCUL integrou no Memorial do Arquivo.pt. Este website deixou de ser atualizado em 2009 quando o projeto terminou. A FCUL investiu recursos na manutenção do website por mais 10 anos até ser necessário desligá-lo por motivos de cibersegurança.
O Memorial do Arquivo.pt surgiu então como uma opção e a partir de 2020, a FCUL passou a ter de manter apenas o domínio www.minema.di.fc.ul.pt enquanto que o Arquivo.pt passou a preservar a informação contida no website.
Faça como a FCUL e preserve os seus websites históricos no Memorial!
Cada vez mais as instituições recorrem ao Memorial do Arquivo.pt para preservar de forma segura os conteúdos dos seus websites históricos. Por exemplo, a FCUL preservou 116 websites, o Centro de Gestão da Rede Informática do Governo preservou 23 e a Fundação para a Ciência e a Tecnologia preservou 40.
As instituições públicas têm prioridade para beneficiar deste serviço. No entanto, outras entidades também o podem solicitar desde que sejam detentoras do domínio do website.
Identifique os seus websites históricos que podem ser integrados no Memorial do Arquivo.pt e contacte-nos!
Última atualização em 16 de Outubro de 2023 às 19:04
Existem páginas arquivadas da web que são reproduzidas de forma incompleta devido a problemas ocorridos durante o processo de arquivo (ex. desformatadas ou com falta de imagens embedidas).
Completar a página é uma funcionalidade do Arquivo.pt que permite recuperar os elementos em falta nas páginas arquivadas a partir de outros arquivos da web ou dos websites originais.
Quando um utilizador visualiza uma página arquivada no Arquivo.pt, basta aceder ao menu Opções no canto superior direito e escolher Completar a página.
Este processo é realizado de forma automática e o Arquivo.pt é o único arquivo da web no mundo que o disponibiliza!
Como funciona o Completar a página?
Se abrir uma página arquivada que lhe pareça incompleta, tente a opção Completar a página e aguarde.
O Arquivo.pt efetuará uma busca pelos elementos em falta, na Internet e noutros arquivos da Web utlizando o protocolo Memento. Em caso de sucessso, os elementos obtidos serão imediatamente mostrados na página.
Posteriormente, estes elementos recuperados são integrados no acervo do Arquivo.pt, para que a página apareça sempre mais completa em futuras consultas realizadas por qualquer utilizador.
Completar a página de entrada do website da artista Cristina Guerra encontrou uma imagem em falta.
Por exemplo, o website da artista Cristina Guerra, arquivado em 2005, tinha uma imagem em falta. Mas utilizando o Completar a página, foi possível em 2021 obtê-la a partir de outro arquivo da web que a tinha preservado e passar a presentar a página de forma mais completa.
Participe na curadoria colaborativa para melhorar a qualidade do Arquivo.pt!
Devido ao elevado número de páginas arquivadas não é possível ao Arquivo.pt tentar completar todas automaticamente. Por isso, a colaboração dos utilizadores para identificar páginas importantes com elementos em falta e tentar completá-las é importante.
Ao utilizar o Completar a página a comunidade de utilizadores está a contribuir para melhorar a qualidade das páginas preservadas no Arquivo.pt!
Experimente sempre completar as páginas arquivadas que lhe pareçam incompletas e se detectar algum problema contacte-nos.
Última atualização em 3 de Novembro de 2023 às 12:47
Arquivo.pt preservou documentos online em várias línguas sobre as Eleições Parlamentares Europeias de 2019
As Eleições Parlamentares Europeias de 2019 foram um evento de relevância internacional. A estratégia para preservar a informação relevante na World Wide Web é delegada às instituições nacionais. No entanto, a preservação de páginas web que documentam eventos internacionais ainda não foi oficialmente atribuída.
A equipa do Arquivo.pt, com o objetivo de preservar o conteúdo online multilingue que documenta este evento, aplicou uma combinação de processos humanos e automáticos de seleção.
Na primeira etapa, foram identificados 40 termos relevantes em português sobre as Eleições Parlamentares Europeias de 2019, que foram posteriormente traduzidos automaticamente para as 24 línguas oficiais da União Europeia: búlgaro, croata, checo, dinamarquês, holandês, inglês, estónio, finlandês, francês, alemão, grego, húngaro, irlandês, italiano, letão, lituano, maltês, polaco, português, romeno, eslovaco, esloveno, espanhol e sueco.
Estas traduções foram revistas em colaboração com o Publications Office of the European Union. Além disso, paralelamente, foi lançada uma lista colaborativa para reunir contribuições de endereços relevantes oriundos da comunidade internacional.
Na segunda etapa, a equipa do Arquivo.pt executou iterativamente 6 recolhas (99 milhões de ficheiros web, 4,8 TB) utilizando diferentes configurações e software de recolha, para maximizar a qualidade do conteúdo recolhido.
Os dados web obtidos foram agregados numa coleção especial identificada como EAWP23 e tornaram-se pesquisáveis e acessíveis através do Arquivo.pt em julho de 2020 (https://arquivo.pt/ee2019).
Projeto CLEOPATRA: Cross-lingual Event-centric Open Analytics Research Academy
A CLEOPATRA ITN foi uma Rede de Formação Inovadora Marie Skłodowska-Curie destinada a gerar formas de compreender melhor a cobertura digital massiva de grandes eventos na Europa durante as últimas décadas.
O principal objetivo era facilitar o processamento avançado multilíngue em grande escala de informações textuais e visuais acerca dos principais eventos contemporâneos e desenvolver métodos inovadores para acesso e interação eficientes com informações multilíngue.
No total, 14 pesquisadores em estágio inicial hospedados em 9 universidades europeias desenvolveram suas pesquisas enquanto estavam matriculados como estudantes de doutoramento.
Parceiros associados como o Arquivo.pt contribuíram para o CLEOPATRA acolhendo e formando investigadores em início de carreira como Diego Alves. No âmbito do programa de formação, este investigador realizou um estágio no Arquivo.pt em Lisboa de junho a agosto de 2022.
A ideia era desenvolver parte da sua investigação sobre estruturas sintáticas das línguas da UE utilizando os recursos textuais preservados pelo Arquivo.pt e trocar conhecimentos com os especialistas em preservação da web sobre estratégias de extração e processamento de dados históricos da web.
Gerando conjuntos de dados textuais para processamento de linguagem natural
O trabalho de Diego Alves originou conjuntos de dados multilíngues sobre as Eleições Parlamentares Europeias de 2019 que constituem recursos preciosos para investigação científica.
Este trabalho será detalhado no capítulo “Robustness of Corpus-based Typological Strategies for Dependency Parsing” do livro de acesso aberto CLEOPATRA intitulado “Event Analytics across Languages and Communities”.
Um fluxo de Processamento de Linguagem Natural em 3 etapas foi desenvolvido para gerar conjuntos de dados textuais que podem ser usados em diversos tipos de estudos na área de Humanidades Digitais:
Extrair texto: O conteúdo textual foi extraído de cada URL arquivado usando a biblioteca Python newspaper3k. O idioma de cada texto extraído foi determinado usando a biblioteca langdetect e os textos escritos em diferentes línguas foram armazenados em ficheiros distintos;
Limpar textos extraídos: um script Python foi aplicado para limpar os textos removendo informações desnecessárias (ex.: instâncias repetidas, linhas vazias, etc.);
Dupla verificação de identificação de língua: a língua de cada texto extraído e limpo foi verificada novamente para eliminar possíveis erros originados durante as etapas anteriores.
Dois novos conjuntos de dados para investigação em acesso-aberto!
O referido corpus foi anotado automaticamente quanto às relações gramaticais e de dependência para gerar um corpus com informações sintáticas úteis para estudos linguísticos.
Os textos anotados seguiram a mesma ordem dos respetivos ficheiros de texto originais. Cada frase foi anotada seguindo a Universal Dependencies framework no formato CoNNL-U, que é a referência em termos de anotação sintática em Processamento de Linguagem Natural. Assim, cada ficheiro deste conjunto de dados contém os textos anotados numa determinada língua sobre as Eleições da União Europeia de 2019.
“Robustness of Corpus-based Typological Strategies for Dependency Parsing”, Diego Alves e Daniel Gomes, livro “Event Analytics across Languages and Communities”, Springer (a ser publicado).
Um dos recursos online mais usados para fins de educação são os artigos da Wikipedia. Porém, por vezes os artigos da Wikipedia referenciam páginas externas com importante informação complementar que entretanto ficou indisponível nos seus websites de origem. Este problema degrada a qualidade da Wikipedia como fonte credível e verificável de informação.
Em agosto de 2023, a equipa do Arquivo.pt realizou uma experiência para medir a percentagem de links externos (fora do domínio wikipedia.org) que estavam quebrados em artigos da Wikipedia portuguesa. Os resultados obtidos mostraram que 25% dos links externos referenciados na Wikipedia portuguesa estavam quebrados.
Acresce o problema de que uma ligação pode referenciar um conteúdo ainda disponível, mas este pode já não ser o que se pretendia referenciar no artigo da Wikipedia, porque o domínio pode ter sido entretanto comprado por terceiros, por exemplo para fins maliciosos (problema de Content Drift).
Para mitigar estes problemas, o Arquivo.pt lançou um projecto para preservar as referências online contidas nos artigos da Wikipedia Portuguesa em colaboração com a Wikimedia Portugal. O objetivo foi alterar as referências para ligações quebradas em artigos na Wikipedia, para passarem a referenciar conteúdos preservados no Arquivo.pt, mantendo assim a informação referenciada acessível aos utilizadores da Wikipedia.
Arquivo.pt preservou as páginas referenciadas nos artigos da Wikipedia Portuguesa
O principal resultado deste projeto foi a criação de um novo processo automático para extrair e recolher os links externos citados em páginas da Wikipedia portuguesa. Este processo passou a fazer parte da operação das recolhas do Arquivo.pt, sendo realizada uma recolha anual das citações da Wikipedia.
Tentativa de consertar automaticamente os links quebrados nos artigos da Wikipedia
Existem robôs de software que adicionam automaticamente ligações para versões arquivadas em artigos da Wikipedia quando encontram ligações quebradas (ex. Pywikibot, Wayback Medic e InternetArchiveBot).
Foi realizada uma experiência para criar um ArquivoPTBot baseado no InternetArchiveBot porque é oferece poderosas ferramentas de operação e monitorização (ex. Dashboard e Insights) e é mantido pelo Internet Archive: o maior arquivo da web do mundo.
Porém, não foi possível lançar este serviço em produção porque implica alterações no sistema para utilizar o Arquivo.pt como fonte de informação arquivada. Se quiser colaborar para conseguirmos retomar este projeto contacte-nos!
Preservar as referências da Wikipedia está ao seu alcance!
O Arquivo.pt continua comprometido em contribuir para preservar os links das referências da Wikipedia e oferece os seguintes serviços que lhe podem ser úteis.
O CitationSaver permite-lhe submeter o código do artigo da Wikipedia e o Arquivo.pt irá automaticamente extrair os links contidos e, arquivar os conteúdos respectivos.
O SavePageNow permite-lhe arquivar imediatamente uma página no Arquivo.pt, por exemplo, que esteja a ser referenciada num artigo da Wikipedia para que não se perca.
Formações Arquivo.pt/Wikimedia
A Wikimedia Portugal em colaboração com o Arquivo.pt promoveu um conjunto de webinars que visou captar a atenção da comunidade para a preservação dos conteúdos publicados e citados na Wikipedia. Os vídeos e slides destes webinars estão disponíveis:
Última atualização em 6 de Agosto de 2024 às 17:24
Os vencedores do Prémio Arquivo.pt 2023 foram anunciados pelo Jornal Público, parceiro oficial de comunicação desta edição, no dia 26 de junho.
Foram recebidos 40 trabalhos candidatos.
A cerimónia de entrega de prémios decorreu na sessão de encerramento do Encontro Ciência, a 7 de julho, na Universidade de Aveiro.
1º classificado – “Viajar no tempo sobre carris”
O vencedor do prémio no valor de 10 000 euros foi o trabalho “Viajar no tempo sobre carris” desenvolvido por Antero Pires, Carlos Cipriano, Diogo Ferreira Nunes e Ruben Martins.
“Viajar no tempo sobre carris” é uma plataforma online que analisa e apresenta a evolução dos tempos de viagens de comboio em Portugal, com base nos horários preservados no Arquivo.pt.
Por exemplo, permite ver a duração da viagem Lisboa-Porto no Alfa Pendular desde o ano 2000.
Este trabalho resultou no website Existo que disponibiliza informação sobre as artistas portuguesas, refere as páginas Web em que foram mencionadas ao longo do tempo. O trabalho baseia-se numa análise da sua representação e visibilidade que permite várias leituras.
Por exemplo, podemos encontrar informação sobre a artista plástica Joana Vasconcelos, notícias de outras artistas em determinado ano ou ainda obter uma visualização gráfica das mulheres artistas em comparação com os homens.
O 3º classificado recebeu um prémio no valor de 2 000 euros e foi atribuído ao trabalho “Memória Política”, desenvolvido por Miguel Lopes, Maria Carneiro e João Andrade.
“Memória Política” é uma aplicação Web que processa e apresenta informação retirada das páginas web dos partidos políticos representados na Assembleia da República, arquivadas pelo Arquivo.pt.
Por exemplo, permite pesquisar o termo “democracia” e obter páginas dos sites dos Partidos relacionadas com a pesquisa, podendo os resultados ser agrupados por Partido e por ano.
O jornal Público, parceiro oficial da 6ª edição do Prémio Arquivo.pt, atribuiu a sua Menção Honrosa ao trabalho “Fábrica do Jornal”, realizado por Miguel Almeida.
“Fábrica do Jornal” é uma aplicação Web que permite ao utilizador gerar um jornal personalizado a partir de notícias preservadas no Arquivo.pt, podendo obter uma versão que pode imprimir ou guardar em formato digital.
“Imaginarium” é uma aplicação Web que faz pesquisa de imagens a partir de semelhanças com outras imagens.
Por exemplo, a partir da sugestão de uma imagem de um automóvel, o “Imaginarium” procura imagens no Arquivo.pt que tenham alguma afinidade com a imagem sugerida.
A entrega de prémios realizou-se na sessão de encerramento do Encontro Ciência 2023, na Universidade de Aveiro, a 7 de julho de 2023.
Os prémios foram entregues pela Ministra da Ciência, Tecnologia e Ensino Superior, Elvira Fortunato, pela Presidente do Conselho Diretivo da FCT, Madalena Alves e pelo Diretor Executivo do Aveiro Media Competence Center, João Moraes Palmeiro.
Nos dias seguintes, 11 e 12 de maio, realizou-se a IIPC Web Archiving Conference (IIPC WAC), uma iniciativa aberta à comunidade, onde podem participar pessoas ou entidades não associodas ao IIPC e interessadas no domínio da preservação da Web.
Contributos do Arquivo.pt na Web Archiving Conference
O Arquivo.pt participou nas reuniões dos grupos de trabalho do IIPC (Training Working Group e Curators Working Group) e contribuiu com apresentações nas sessões temáticas Collaborations & Outreach e Program infrastructure (sessões 7 e 17).
O Arquivo.pt contribuiu com apresentações para as sessões Web Archive in Mediterranean area and its merge(4.A,), From online Tools to Web Archive (6.B.), Towards a participatory approach to collections (9. A.), Digging up the materials for writing web history (9.B.).
How to research governmental web data? (abstract, slides)
O Arquivo.pt participou em três cursos: Incentives design for hybrid multilingual information processing and analytics, em Southampton; National and transnational media coverage of European parliamentary elections, 2004-2014, Londres; e NLP for under-resourced languages, em Zagreb, na Croácia.
Em 2022, o Arquivo.pt acolheu dois investigadores nas suas instalações os quais utilizaram os recursos arquivados e tiveram apoio especial da equipa do Arquivo.pt para desenvolverem a sua investigação.
O projeto CLEOPATRA terminou em 2023 com a realização de um encontro a 16 de maio, em Hannover, que reuniu professores, investigadores e representantes de instituições envolvidas.
Daniel Gomes, Gestor do Arquivo.pt, destacou as novas ferramentas que o Arquivo.pt disponibiza e os resultados dos trabalhos realizados pelos investigadores que passaram pelo Arquivo.pt.
Secondments@Arquivo.pt and new research tools available (Slides)
Este evento é um encontro para partilha de conhecimento entre as entidades que compõem a comunidade de ensino superior e de investigação nacionais.
O evento conta com a participação de decisores das instituições, responsáveis por serviços técnicos de informática e responsáveis por bibliotecas e serviços de documentação, entre outros.
O Arquivo.pt apresentou duas sessões de 90 minutos, no dia 28 de junho das 14h30 às 18h00, sob o tema “Serviços Arquivo.pt para gerir citações e cibersegurança”.
Agenda da sessões Arquivo.pt
28 de junho 14h30-16h00: Arquivo.pt – serviços disponíveis e arquitetura de sistema
Entre os conteúdos digitalizados que podem ser consultados no catálogo e acedidos nas instituições provedoras encontravam-se som, imagem, fotografia, material impresso digitalizado. Contudo, faltavam os Websites.
Assim, surgiu a ideia da nova coleção “Páginas Web” do MUVITUR.
Colaboração entre o MUVITUR e o Arquivo.pt
Em 2019, iniciou-se uma colaboração entre o Arquivo.pt e o MUVITUR com o objetivo de identificar sites relacionados com o Turismo em Portugal e de divulgar o histórico de conteúdos publicados na Web, desde 1996.
Em 2022, estabeleceu-se uma lista com cerca de 400 registos de websites de diversas entidades ligadas ao Turismo, hotéis, agências de viagens, páginas dos sites dos municípios com informação turística e outras.
O MUVITUR utiliza o software Nyron, o qual permite agregar conteúdos de diversas proveniências através do protocolo interoperabilidade OAI-PMH (Open Archives Initiative Protocol for Metadata Harvesting), cuja utilização é muito comum entre bibliotecas, arquivos e museus para fornecer conteúdos a portais, como por exemplo o Europeana.
O Arquivo.pt, porém, não disponibiliza informação através do OAI-PMH, pelo que foi necessário encontrar uma forma alternativa de criar um registo no Nyron com informação descritiva de Websites preservados.
O procedimento para a integração foi o seguinte:
Exportou-se para uma folha Excel o esquema XML com os campos para os metadados, de acordo com o que funciona no Nyron;
A informação foi inserida manualmente na folha Excel, respeitando o formato e a sintaxe, em colaboração com os técnicos responsáveis pelo sistema;
O ficheiro XML com os dados inseridos foi validado e importado para o Nyron.
A criação de registos em catálogos é em grande parte manual e exige uma curadoria humana. No entanto, foi possível introduzir informação para ser processada automaticamente nos registos da coleção de Websites. Por exemplo, a miniatura (thumbnail) foi obtida utilizando a API do Arquivo.pt, mais espeicificamento o linkToScreenShot, visível nos detalhes técnicos de uma página preservada (ver em Opções).
Para outros elementos, tais como o título do site, seria possível obtê-los automaticamente através da API do Arquivo.pt, no entanto a qualidade da informação depende do que os produtores do site inseriram e pode não ser a melhor. As datas para limitar o âmbito temporal também podem ser obtidas de forma automática. Privilegiou-se o método manual para controlar a informação apresentada.
Na continuidade do projeto, a coleção vai ser aumentada com novos registos, pois existem milhares de sites sobre o setor do Turismo.
Descrição de conteúdos Web no catálogo do MUVITUR
Na coleção “Paginas Web” são utilizados os seguintes dados:
Denominação – geralmente o título do website
Organização – a entidade a quem pertence a publicação
Endereço do sítio Web na Internet
Endereço para versão no Arquivo.pt
Momento(s) para recordar
Link para miniatura no Arquivo.pt
Descritores
Dados geográficos (localização, coordenadas, nome geográfico)
A apresentação da informação foi ajustada para ficar alinhada com a de outros recursos do MUVITUR e contém ligações para o Arquivo.pt.
Por exemplo, no registo do site “Turismo do Algarve”, encontramos uma ligação para um momento a recordar em 2011 e outra a ligação para o histórico no Arquivo.pt em “Consultar objeto”.
Organizações podem criar coleções de Websites da sua área
Com este projeto inédito podemos dizer que os Websites preservados ganharam cidadania ou espaço em plataformas digitais dedicadas à memória histórica.
Os Websites raramente são incluídos em catálogos ou expostos em contexto museológico, em Portugal. Em breve, essa realidade pode mudar.
A National Library of Australia, por exemplo, tem registos de Websites preservados no catálogo. Na Tasmania Libraries o catálogo bibliográfico descreve em formato Marc21 mais de 3000 Websites preservados. Na Library of Congress há coleções de Websites antigos ao lado dos recursos tradicionais.
O MUVITUR abriu caminho para que outras entidades criem coleções de Websites do seu interesse nas suas plataformas.
A comunidade académica e de investigação tem solicitado a possibilidade de descarregar automaticamente seleções de conteúdos arquivados e ficheiros de índice (CDXJ), por exemplo, para alimentar modelos de aprendizagem automática de Inteligência Artificial ou recuperar informação de sítios web selecionados (ex. notícias ou websites que foram atacados).
O Arquivo.pt passou a disponibilizar publicamente os seus ficheiros de índice CDXJ em tempo real, para facilitar o acesso automático a grandes volumes de conteúdos arquivados da web. Saiba como em: