Mostrando entradas con la etiqueta gobierno. Mostrar todas las entradas
Mostrando entradas con la etiqueta gobierno. Mostrar todas las entradas

Preservación

Hace un par de meses que en mi cabeza ronda la idea de "la necesidad de una infraestructura centralizada para la preservación de los datos gubernamentales". Quizás porque el proyecto subyacente es una mezcla de mis dos especialidades: Infraestructura + Datos. Luego de lanzar la idea, sin mucho desarrollo, una respuesta fué que esta problemática es la misma que los libros, donde la solución es asegurar la preservación mediante la distribución en distintas bibliotecas. Nada más cierto, ese es el modelo que se debe seguir, veamos que es lo que dice el "otro DCC" al respecto.


El "Digital Curation Centre" (DCC en UK): "El objetivo del centro es proporcionar un enfoque nacional para la investigación y el desarrollo en cuestiones de preservación y promover conocimientos y buenas prácticas, tanto nacionales como internacionales, para la gestión de todos los resultados de la investigación en formato digital". Partes de las problemáticas que se deben tratar con la preservación digital están: Obsolescencia tecnológica, Conservación, Autenticidad y Confianza. El enfoque que tiene el DCC es sobre los datos generados para materias científicas y académica. Pensemos que los datos gubernamentales serán de interés para alguna de las ramas científicas, como por ejemplo para los estudios sociológicos.

El DCC propone un modelo para manejar el ciclo de vida de preservación, que en parte se refleja en la figura presentada arriba en esta entrada. Sobre una eventual propuesta de infraestructura centralizada para alojar los datos el DCC publicó un Estudio de Infraestructura Nacional de Datos, donde luego de revisar la realidad de distintos países, se destacan algunos antecedentes:

1.- No existen ni políticas ni infraestructura centralizada a nivel nacional
2.- Las políticas son institucionales y de organismos de financiación de investigación
3.- Las soluciones nacionales se plantean como distribuidas, entregando el ambiente requerido
4.- Los costos y la provisión de infraestructura son temas abiertos

Podemos concluir entonces, que más que una "infraestructura centralizada" lo más conveniente es implementar un modelo distribuido para asegurar la preservación de los datos, al estilo de The Dataverse Network Project, que se asemeja a "una red de bibliotecas" para datos académicos/científicos.

Es importante notar que el mundo de los datos generados desde las áreas académicas y científicas están concentrando la atención, como es el caso del libro recientemente publicado por Microsoft Research "The Fourth Paradigm: Data-Intensive Scientific Discovery". Esta área de interés, el dominio científico/académico, pudo ser uno de los evaluados para los casos de estudio desarrollados en la tesis y quizás quedaba fuera por "presentar demasiados datos y no tener la infraestructura para alojarlos".


En el mismo tema de preservación, pero ahora relacionado con "linkeddata" y datos de gobierno, es justamente en UK, donde siguiendo los pasos de EEUU, Australia y Nueva Zelanda están lanzando su plataforma para exponer datos en la Web, pero esta vez asesorados por TBL, uno de sus primeros documentos generados dice relación con el diseño de URI para el sector público, donde se destaca las siguientes recomendaciones novedosas:
  • "El conjunto de URI (URI set, ver figura arriba en esta entrada) que se promueven para la reutilización deben ser diseñados para durar al menos 10 años" (final de la página 3).

  • "Sobre el dominio de un Conjunto de URI que se promueven para la reutilización: ... se mantenga a perpetuidad; No contenga el nombre del departamento o agencia ... ya que puede ser reasignada" (punto 3 en la página 6).
El hecho de colocar como primer lineamiento el de Diseño de URI no es casualidad, claramente se está siguiendo el stack de la Web Semántica.


Caracterizando la implementación de Gobierno Transparente


La implementación para cumplir la "Ley N° 20.285 - sobre Acceso a la Información Pública", denominada "Gobierno Transparente", tiene un sabor a "linkeddata". La opción tradicional implicaba implementar un sistema centralizado, donde se cargan los datos y permite consultar. Recordemos que la forma de cumplir con la normativa de publicar los datos en la web, se implementó con un modelo distribuido pero asistido, pasando por el siguiente flujo para cada servicio:

- Bajar las planillas desde http://www.gobiernotransparente.cl/

- Llenar las planillas con los datos respectivos (*)

- Utilizar los asistentes disponibles para generar las páginas con los datos, url (**) e índices

- Subir la información a cada sitio web (***)


Las particularidades corresponden a los puntos con asteriscos, que presentan una similitud con el modelo de datos linkeados en la web (linkeddata):

(*) Lo que se está haciendo al llenar una planilla es "crear instancias de una clase", asi cada fila de la planilla es una "instancia de la clase que define la planilla" con las "propiedades detalladas en el encabezado de la hoja". En la práctica, la planilla es "el esquema".
(**) Algunas url están "linkeando" a otros sistemas, que luego pueden extenderse con más información, ver por ejemplo listado de urls de "chileclic", y listado de urls del "Registros Ley N° 19.862".

(***) Al publicar las páginas en cada sitio, se da libertad para "ajustar" el formato de las páginas y urls.

Al utilizar un modelo distribuido, se tienen problemáticas similares a las de "linkeddata":

- Se requiere tipos de datos estrictos (e.g. para fecha, valores)

- Existe una evolución de vocabulario (e.g. cambio de planilla para dotación entre años)

- Es necesario contar con taxonomias para realizar agregación automática (e.g. nombre de servicios/instituciones, tipo de pagina)

Existen pocas soluciones de este tipo y quitando el antecedente del formato en que se serializan los datos, se tiene una oportunidad, ya que "conceptualmente el problema es el mismo que si tuvieramos los datos con RDF", en particular están incluidos los problemas listados anteriormente. Bajo este análisis y convencido cada vez más que la fuente de datos del "Gobierno transparente" puede ser explotada ahora, he comenzado con una serie de tareas que permitan caracterizar mejor los sub-sitios que mantiene cada servicio. Estas tareas son:

1.- Construir un listado de instituciones con páginas de transparencia

2.- Implementar un "sistema asistido" para: clasificar las páginas y rescatar los esquemas

3.- Presentar opciones de consulta que permita caracterizar cada sub-sitio


Construir un listado de instituciones con páginas de transparencia

Anteriormente ya se tenía un listado de instituciones, ahora se presenta el listado actualizado, con mas antecedentes y con opciones de filtrado (ofrecidos por exhibit). El listado es mantenido en una hoja de google spreadsheets.

Ver listado.

La información del listado proviene del sitio chileclic y se puede complementar con la información existente en la Dirección de Presupuesto, del Ministerio de Hacienda.

Implementar un "sistema asistido" para: clasificar las páginas y rescatar los esquemas

Mediante un sistema de bookmarklet y gracias a que cada página de los sub-sitios mantienen un formato estandarizado, es posible rescatar la siguiente información: url, institución, clase, periodo, actualización y esquema. Los datos son presentados para que puedan ser editados (funciona como una ventana de delicious o un bookmarklet de diigo) y luego son enviado mediante un formulario a una hoja de google spreadsheets.

La parte novedosa de esta herramienta consiste en utilizar un algoritmo de similaridad de strings (levenshtein) para buscar y normalizar el nombre de la institución, para ello es mandatorio contar con la lista de instituciones (descrita en el punto anterior).

Copiar el bookmarklet ClasificadorTransparencia a la barra de marcadores.



Presentar opciones de consulta que permita caracterizar cada sub-sitio

Utilizando opciones de filtrado y facetas (ofrecidos por exhibit), es posible "recorrer" el listado de páginas y esquemas recolectados con la herramienta del "sistema asistido", permitiendo caracterizar el número de páginas por institución, categoría, año y tipo.

Consultar características de páginas para 20+ instituciones.

Los pasos siguientes son:

1.- agregar opciones avanzadas para detectar clase (tipo de página), la consecuente categoría y parsear mejor el periodo

2.- permitir actualizar la clasificación de una página y dar opciones de colaboración

3.- recolectar las instancias de cada página, para ello ya se tiene un prototipo para el bookmarklet de DatosTransparencia

4.- presentar opciones para caracterizar y consular las instancias


Día 3 y Día 4

El día miércoles pude dedicar poco tiempo al trabajo de tesis, principalmente revisando alguna solución para generar RDF y publicarlos.

El día jueves se dedicó a generar RDF desde los datos parseados de transparencia, el trabajo estuvo acotado a los datos de Dotación (el 80-20 de los datos). Gran parte del esfuerzo fue destinado a clasificar los datos, particionando las tablas según los siguientes criterios:
  • Tipo de dotación (planta, contrata, honorario, otra)
  • Fecha (el año al que corresponden los datos)
El principal problema encontrado fue la cantidad de esquemas distintos que se publican para cada tipo de datos, entendiendo que los headers de las tablas representan el esquema. Para muestra, y luego de normalizar las etiquetas, se encuentran los siguientes 31 esquemas:
  1. contrato|estamento|paterno|materno|nombres|grado|funcion|region|nombreregion|ingreso|ini|fin|obs|
  2. dotacion|estamento|paterno|materno|nombres|grado|funcion|region|ini|fin|obs|
  3. estamento|paterno|materno|nombres|grado|funcion|region|ini|
  4. estamento|paterno|materno|nombres|grado|funcion|region|ini|fin|obs|
  5. estamento|paterno|materno|nombres|grado|funcion|region|ini|fin|obs|estab|
  6. estamento|paterno|materno|nombres|grado|funcion|region|ini|fin|obs|ley afecto|
  7. estamento|paterno|materno|nombres|grado|funcion|region|renta|ini|fin|
  8. estamento|paterno|materno|nombres|grado horas|funcion|region|ini|fin|obs|
  9. estamento|paterno|materno|nombres|obs|grado|region|ini|fin|
  10. estamento|rut|dv|corr|paterno|materno|nombres|obs|grado|region|ini|fin|
  11. n|estamento|paterno|materno|nombres|grado|
  12. n|estamento|paterno|materno|nombres|grado|region|ini|fin|obs|
  13. n|estamento|paterno|materno|nombres|obs|funcion|calificacion|region|ini|fin|estab|
  14. n|estamento|paterno|materno|nombres|obs|grado|region|ini|fin|
  15. n|estamento|paterno|materno|nombres|obs|grado|region|ini|fin|estab|
  16. n|estamento|paterno|materno|nombres|obs|grado|region|ini|fin|n res.|
  17. n|n|estamento|paterno|materno|nombres|obs|grado|region|ini|fin|
  18. n|paterno|materno|nombres|funcion|calificacion|
  19. n|paterno|materno|nombres|funcion|calificacion|grado|region|um|honorario|ini|fin|obs|
  20. n|paterno|materno|nombres|funcion|calificacion|region|ini|fin|
  21. n|paterno|materno|nombres|funcion|calificacion|region||ini|fin|estab|obs|
  22. n|paterno|materno|nombres|obs|funcion|calificacion|region|ini|fin|
  23. n|paterno|materno|nombres|obs|grado|region|ini|fin|
  24. n|planta|estamento|corr|paterno|materno|nombres|grado|region|ini|fin|obs|
  25. n|planta|estamento|corr|paterno|materno|nombres|region|grado|ini|fin|estab|funcion|profesion|obs|
  26. n|planta|estamento|paterno|materno|nombres|region|grado|ini|fin|estab|funcion|profesion|obs|
  27. paterno|materno|nombres|funcion|calificacion|grado|region|um|honorario|ini|fin|obs|
  28. paterno|materno|nombres|funcion|calificacion|region|um|honorario|ini y fin|obs|
  29. paterno|materno|nombres|funcion|grado|region|um|remuneracion|ini|fin|obs|
  30. paterno|materno|nombres|obs|funcion|calificacion|region|ini|fin|
  31. paterno|materno|nombres|obs|funcion|profesion|region|ini|fin|
La buena noticia, es que justamente una de las características de RDF es la flexibilidad en sus esquemas, por lo que sin importar que existan entidades que difieran en cantidad o tipos de atributos, esto no es un problema.

Luego, al tener los esquemas de cada archivo procesado normalizado, la generación de RDF es directa, ver en el update del repositorio los cambios en el código con los script de generación.

Al aplicar sobre 50M de datos tabulados, se generaron 300M de datos en RDF serializados en xml.

Cada "entrada de dotación" se modeló con el siguiente esquema:


Una instancia de dotación, se describe de la siguiente forma con el vocabulario visual:
Lo que viene es dejar todos los datos en un triplestore y presentar por facetas.

Día 2

Ayer fue el segundo día full time en la universidad. El trabajo realizado estuvo centrado en parsear los datos de transparencia para los tres ministerios seleccionados, a recordar: educación, justicia y salud. Previamente se almacenó el resultado de crawlear los sitios de transparencia en cada ministerio.

Ver en el update del repositorio los cambios en el código. Entre los problemas encontrados durante el parser están:
  • El Servicio Médico Legal (SML) tiene los links con javascript, por eso el crawler no trajo datos.
  • De un total de 5466 páginas ( 141 educación, 277 justicia, 5048 salud ) en 47 (aprox. un 1%) existió un fallo del parser por errores de sintaxis en el html, a esas páginas se les aplicó tidy para arreglar los problemas, lo que no resultó para 7 de estos documentos.
  • El ministerio de salud, y sus organizaciones, presenta una copia de sus datos para distintos meses del año 2009 (al menos desde marzo).
  • Existen cambios en los esquemas para el año 2009, en especial afecta a las Transferencias, Compras y Dotación.
Al aplicar el parser (proceso automático, que tomó 3 horas) y particionar los datos (proceso manual, que tomó 2 horas), se obtuvieron los siguientes resultados de interés:

Item Data
Auditoría 0,05%
Vínculo 0,12%
Subsidio 0,28%
Participación 0,35%
Remuneración 0,38%
Tramite 1,07%
Compra 3,51%
Normativa 5,03%
Transferencia 10,59%
Dotación 78,62%

Como se puede observar el 80/20 de los datos corresponde a información de dotación. Analizando el número de dotación crawleadas, con respecto a las que se tiene en el estudio de recursos humanos en el sector publico, vemos que los datos corresponden, al menos en el orden de magnitud.


estudio crawler
educación 12k 5k
justicia 19k 22k
salud 85k 80k

Queda por validar que ocurre con el ministerio de educación, donde solo se encontró la mitad de las personas, quizás falta incluir alguna organización dependiente. El detalle de organismos crawleados es el siguiente:

Ministerio Nombre Alias
Justicia Servicio de Registro Civil e Identificación srcei
Justicia Superintendencia de Quiebras squiebras
Justicia Servicio Medico Legal sml
Justicia Servicio Nacional de Menores sename
Justicia Gendarmería de Chile gendarmeria
Justicia Defensoría Penal Pública dpp
Salud Central de Abastecimiento cenabast
Salud Fondo Nacional de Salud fonasa
Salud Instituto de Salud Pública isp
Salud Servicios de Salud Arica SSARICA
Salud Servicios de Salud Iquique SSIQUIQUE
Salud Servicios de Salud Antofagasta SSANTOFAGASTA
Salud Servicios de Salud Atacama SSATACAMA
Salud Servicios de Salud Coquimbo SSCOQ
Salud Servicios de Salud Aconcagua SSACONCAGUA
Salud Servicios de Salud Viña del Mar Quillota SSVQ
Salud Servicios de Salud Valparaíso San Antonio SSVSA
Salud Servicios de Salud Metropolitano Norte SSMETRONORTE
Salud Servicios de Salud Metropolitano Central SSMC.
Salud Servicios de Salud Metropolitano Oriente S.S.M.O.
Salud Servicios de Salud Metropolitano Sur SSMETROSUR
Salud Servicios de Salud Metropolitano Sur Oriente SSMETROSURORIENTE
Salud Servicios de Salud Metropolitano Occidente SALUD OCCIDENTE
Salud Servicios de Salud Libertador B. O'Higgins SSOHIGGINS
Salud Servicios de Salud del Maule SSMAULE
Salud Servicios de Salud Ñuble SSNUBLE
Salud Servicios de Salud Concepción SSC
Salud Servicios de Salud Arauco SSARAUCO
Salud Servicios de Salud Talcahuano SSTALCAHUANO
Salud Servicios de Salud Bio Bio SSBIOBIO
Salud Servicios de Salud Araucanía Norte SSARAUCANIANORTE
Salud Servicios de Salud Araucanía Sur SASS
Salud Servicios de Salud Valdivia SSVALDIVIA
Salud Servicios de Salud Osorno SSOSORNO
Salud Servicios de Salud del Reloncaví SSDELRELONCAVI
Salud Servicios de Salud Chiloé SSCHILOE
Salud Servicios de Salud Aysén SSAYSEN
Salud Servicios de Salud Magallanes SSMagallanes
Salud Seremi de Salud Región de Arica y Parinacota SEREMI15
Salud Seremi de Salud Región de Tarapacá SEREMI1
Salud Seremi de Salud Región de Antofagasta SEREMI2
Salud Seremi de Salud Región de Atacama SEREMI3
Salud Seremi de Salud Región de Coquimbo SEREMI4
Salud Seremi de Salud Región de Valparaíso SEREMI5
Salud Seremi de Salud Región Metropolitana SEREMI13
Salud Seremi de Salud Región de O'Higgins SEREMI6
Salud Seremi de Salud Región del Maule SEREMI7
Salud Seremi de Salud Región del Bio Bio SEREMI8
Salud Seremi de Salud Región de la Araucanía SEREMI9
Salud Seremi de Salud Región de Los Ríos SEREMI14
Salud Seremi de Salud Región de Los Lagos SEREMI10
Salud Seremi de Salud Región de Aisén SEREMI11
Salud Seremi de Salud Región de Magallanes y Antártica Chilena SEREMI12
Salud Establecimiento Experimental Centro de Referencia de Salud de Maipú CRS MAIPU
Salud Establecimiento Experimental CRS Cordillera Oriente CRSCO
Salud Establecimiento Experimental Hospital Padre Hurtado HPADREHURTADO


Datos abiertos de gobierno

Ocho principios de datos abiertos de gobierno

En diciembre del 2007 en Sebastopol, California, un grupo de treinta "defensores de gobierno abierto", entre los que destacan Tim O'Reilly (el mismo de los libros técnicos con portadas de animales), Adrian Holovaty (creador de django y everyblock, a todo esto, everyblock fue comprado por msnbc) y Aaron Swartz (un "viejo conocido"), se reunieron a desarrollar un conjunto de principios para datos abiertos de gobierno, los cuales se detallan a continuación:

  1. Completo: todos los datos públicos está disponible. Los datos público no contempla datos privados ni limitaciones de seguridad o privilegios.
  2. Primario: los datos son recolectados en la fuente de origen, con el nivel de granularidad mas alto posible, no en forma agregada ni modificada.
  3. Oportuno: los datos están disponibles tan rápido como sea necesario para preservar el valor de los datos.
  4. Accesible: los datos están disponibles para el rango mas amplio de usuarios para el rango mas amplio de propósitos.
  5. Procesable por maquinas: los datos están estructurados razonablemente para permitir un procesamiento automático.
  6. No discriminatorio: los datos están disponibles a cualquiera, sin requerir un registro.
  7. No propietario: los datos están disponibles en un formato sobre el cual ninguna entidad tiene un control exclusivo.
  8. Libre de licencias: los datos no están sujetas a ningún derecho de autor, patenté, marca registrada o regulaciones de acuerdo de secreto. Razonable privacidad, limitaciones de seguridad y privilegios están permitidos.

El cumplimiento debe ser revisable.

Definiciones
"público" significa: Los principios de datos abiertos de gobierno no apuntan a que los datos deban ser públicos y abiertos. La privacidad, seguridad y otros asuntos pueden legalmente (y de derecho) prevenir que un conjuntos de datos se compartan públicamente. Más bien, estos principios especifican las condiciones de que los datos públicos deben cumplir para ser considerado "abierto".

"data" significa: La información almacenada electrónicamente o grabada. Ejemplos de esto incluyen documentos, bases de contratos, transcripciones de audiencias, y eventos grabados en audio o video. Mientras los recursos de información no electrónicos, tales como artefactos físicos, no están sujetos a los principios de datos abiertos de gobierno, siempre es alentador que esos recursos estén disponibles por vía electrónica a la medida de lo posible.

"revisable" significa: Se debe designar una persona de contacto para responder a las personas que intenten usar los datos. Se debe designar Una persona de contacto para responder a las quejas sobre violaciones de los principios. Un tribunal administrativo o judicial debe tener la jurisdicción para examinar si los organismos han aplicado estos principios adecuadamente.

Modelo de datos abiertos

El modelo general para el tratamiento de datos abiertos se sintetiza de forma simple y clara en el sitio theinfo.org (iniciado por el mismo Aaron Swartz) y contempla tres niveles.

NivelObtenerProcesarVisualizar
Itemsscrapers
crawlers
phone calls
buyouts
conversions
queries
regressions
collaborative filtering
tables
graphs
maps
web sites


Agregador temporal para data gubernamental

Resulta interesante de revisar el sitio EveryBlock, en el se presenta un agregador de información por ciudades, donde se destaca la clasificación temporal. Entre los datos que se presentan están: patentes de negocios, permisos de construcción, transferencias de propiedad, etc. Además, por cada "tipo de información" se presenta una descripción. Por ejemplo, en esta pagina se muestra la descripción de la información relativa a Patentes de negocios para la ciudad de Chicago, donde se indica claramente cual es la fuente de la información.

Al parecer (ver el faq de EveryBlock), la información que sustenta el sitio es rescatada utilizando scrapers, al estilo del que estamos construyendo para InfoEscuela.

Creo que este es un excelente modelo para agregar la información relativa a transparencia en el gobierno.

Evaluación de dominio para los casos de estudio

En el siguiente cuadro se presenta una evaluación para los dominios a trabajar en los casos de estudio.

Dominio Volumen de datos
Utilidad Impacto
Escuelas medio alto alto
Órganos del Estado alto alto medio
Deportes bajo media alto
Medios bajo baja alto

Las categorías seleccionadas son: Escuelas y Órganos del Estado, ya que tienen un volumen de datos razonable, presentan un beneficio social (utilidad) y mayor impacto.

Páginas de transparencia

Tengo el siguiente levantamiento con los enlaces a paginas de transparencia en los órganos del estado.

Raw data now

El viernes pasado revisamos la solución de publicación de información en el contexto de transparencia del gobierno. La implementación consiste en que cada órgano del estado debe seguir una normativa para publicar la siguiente información:

  1. Adquisición y Contratación
  2. Personal
  3. Transferencias
  4. Marcos normativos
  5. Actos y Resoluciones

Encontré el siguiente buscador de las paginas del gobierno transparente, implementado sobre google. No es un buscador semántico, seguramente por la falta de la data estructurada. Una alternativa para obtener información "marcada", a partir de las paginas publicadas de gobierno transparente, es utilizar un "Screen Scrapers" (como dapper o piggy bank) sobre cada pagina publicada en los sitios gubernamentales, para luego generar y publicar la data. Antes de esto se debe generar el esquema de la información (ontología).

Quizás hace falta mayor difusión al estilo de TimBL, quien hace gritar "RAW DATA NOW" a los asistentes a su charla en TED.