Het identificeren van niet-opeenvolgende waarden is altijd een beetje lastig en omvat verschillende geneste subquery's (ik kan tenminste geen betere oplossing bedenken).
De eerste stap is het identificeren van niet-opeenvolgende waarden voor het jaar:
Stap 1) Identificeer niet-opeenvolgende waarden
select company,
profession,
year,
case
when row_number() over (partition by company, profession order by year) = 1 or
year - lag(year,1,year) over (partition by company, profession order by year) > 1 then 1
else 0
end as group_cnt
from qualification
Dit geeft het volgende resultaat:
company | profession | year | group_cnt ---------+------------+------+----------- Google | Programmer | 2000 | 1 Google | Sales | 2000 | 1 Google | Sales | 2001 | 0 Google | Sales | 2002 | 0 Google | Sales | 2004 | 1 Mozilla | Sales | 2002 | 1
Nu kunnen we met de group_cnt-waarde "groeps-ID's" maken voor elke groep die opeenvolgende jaren heeft:
Stap 2) Definieer groeps-ID's
select company,
profession,
year,
sum(group_cnt) over (order by company, profession, year) as group_nr
from (
select company,
profession,
year,
case
when row_number() over (partition by company, profession order by year) = 1 or
year - lag(year,1,year) over (partition by company, profession order by year) > 1 then 1
else 0
end as group_cnt
from qualification
) t1
Dit geeft het volgende resultaat:
company | profession | year | group_nr ---------+------------+------+---------- Google | Programmer | 2000 | 1 Google | Sales | 2000 | 2 Google | Sales | 2001 | 2 Google | Sales | 2002 | 2 Google | Sales | 2004 | 3 Mozilla | Sales | 2002 | 4 (6 rows)
Zoals je kunt zien heeft elke "groep" zijn eigen group_nr en dit kunnen we eindelijk gebruiken om te aggregeren door nog een andere afgeleide tabel toe te voegen:
Stap 3) Laatste vraag
select company,
profession,
array_agg(year) as years
from (
select company,
profession,
year,
sum(group_cnt) over (order by company, profession, year) as group_nr
from (
select company,
profession,
year,
case
when row_number() over (partition by company, profession order by year) = 1 or
year - lag(year,1,year) over (partition by company, profession order by year) > 1 then 1
else 0
end as group_cnt
from qualification
) t1
) t2
group by company, profession, group_nr
order by company, profession, group_nr
Dit geeft het volgende resultaat:
company | profession | years ---------+------------+------------------ Google | Programmer | {2000} Google | Sales | {2000,2001,2002} Google | Sales | {2004} Mozilla | Sales | {2002} (4 rows)
Dat is precies wat je wilde, als ik me niet vergis.