Het bouwen van zeer nauwkeurige, synthetische datasets van belastingzaken voor de evaluatie van AI in de Amerikaanse belastingwetgeving.

Hoe Shaip 2,000 realistische Amerikaanse belastinggevallen creëerde met federale en staatsaangiften, ondersteunende documenten, workflows in CPA-stijl, validatie door experts in de financiële sector en anonimiseringscontroles voor het testen van AI voor bedrijfsbelastingen.

Synthetische belastingdataset

Projectoverzicht: Synthetische belastingdataset voor AI-evaluatie

Naarmate AI-systemen voor belastingaangiften geavanceerder worden, wordt de kwaliteit van de evaluatiegegevens een cruciale onderscheidende factor. De klant had behoefte aan een grootschalige dataset met realistische individuele belastingaangiftegevallen, die de federale aangiftevereisten plus de variaties op staatsniveau in Californië, Texas, New York, Illinois en Florida omvatten. Elk geval moest de daadwerkelijke workflow van een registeraccountant nabootsen en een volledig intakeformulier, ondersteunende brondocumentatie, afgestemde belastingformulieren, samenvattingen voor het management en moeilijkheidsgradenlabels bevatten.

Shaip kreeg de opdracht een productiegereed dataset-pipeline te ontwerpen die in staat was om te genereren. 2,000 volledig afgestemde belastingdossiers, met de operationele capaciteit om op te schalen naar 5,000 gevallen Naarmate het programma zich uitbreidde, moest de dataset de meest recente belastingjaren omvatten, een evenwichtige weergave bieden van de complexiteit van middelmatig tot matig complexe gevallen, en strikte kwaliteitscontroles handhaven met betrekking tot consistentie, anonimisering, opmaak en het voorkomen van duplicaten.

Dataset van belastingzaken

Belangrijkste datasetstatistieken

Datasetvolume

2,000 belastingzaken

Schaalbaarheid

Capaciteit om uit te breiden naar 5,000 gevallen

Ondersteunende documenten

7-15 documenten per dossier

Leveringsdoorvoer

300-400 datasets per week

Uitdagingen bij de evaluatie van AI voor belastingdoeleinden

  • Ervoor zorgen dat elke zaak een realistische workflow in de stijl van een registeraccountant volgde, met intern consistente beschrijvingen van de belastingplichtige, brondocumenten en definitieve aangiften.
  • Het verwerken van staatspecifieke belastingregels in vijf staten, met behoud van afstemming op federale formulieren en overzichten.
  • Het opstellen van middelmatig tot redelijk complexe belastingscenario's met betrekking tot HSA's, inkomsten uit meerdere staten, K-1-formulieren, ACA-formulieren, bijlage C, vermogenswinsten en buitenlandse rekeningen.
  • Het handhaven van strikte normen voor gegevensintegriteit, opmaak en volledigheid, inclusief het uitsluitend aanleveren van PDF-bestanden en het afwijzen van onvolledige, dubbele of structureel inconsistente bestanden.
  • Bescherming van de privacy door middel van synthetische of geanonimiseerde datasets met anonimiseringsmaatregelen en een meerfasige beoordeling.

Shaip's synthetische belastinggegevensoplossing

Gegevensstrategie

Shaip structureerde de samenwerking rond de productie van 2,000 realistische individuele belastinggevallen, elk ontworpen voor evaluatie- en testdoeleinden. De workflow is ontwikkeld om toekomstige schaalvergroting te ondersteunen. 5,000 gevallen Zonder afbreuk te doen aan consistentie of kwaliteit. De casussen zijn zo ontworpen dat ze de afgelopen vijf belastingjaren vertegenwoordigen, met een sterkere vertegenwoordiging van recentere aangifteperioden.

Casusontwerp en intake-modellering

Elke casus bevatte een gedetailleerde vragenlijst voor de cliënt, waarin persoonlijke gegevens, aangiftepositie, gezinsleden, werkgelegenheid, aandelencompensatie, pensioeninkomen, 1099-inkomen, K-1-formulieren, huurinkomen, buitenlands inkomen, aftrekposten, belastingkredieten, nalevingsgeschiedenis en staatspecifieke vereisten werden opgenomen. Dit zorgde ervoor dat elk scenario de informatieverzamelingsfase van een echte belastingopdracht weerspiegelde.

Aanmaken van een documentpakket

Om elke dossierset levensecht en klaar voor beoordeling te maken, bevatte elke zaak een pakket met ondersteunende documenten zoals W-2's, 1099-INT/DIV/B, 1099-R, 1099-NEC/MISC, K-1's, 1095-A, hypotheekrenteformulieren, onroerendgoedbelastingaanslagen, makelaarsoverzichten, huurovereenkomsten, bankafschriften, zakelijke onkostenbonnen en HSA/IRA-gegevens.

Aangiftevoorbereiding en -afstemming

Elke dataset bevatte voltooide federale en staatsbelastingaangifteformulierenInclusief formulier 1040 en de bijbehorende bijlagen, plus aangifteformulieren van de staat en gerelateerde krediet- of voucherdocumenten waar nodig. Beknopte samenvattingen voor leidinggevenden bevatten het gecorrigeerde bruto-inkomen (AGI), het belastbaar inkomen, de totale belasting, betalingen, terugbetalingen of openstaande bedragen, boetes en het effectieve belastingtarief, met samenvattingsvelden op staatsniveau.

Complexiteitskader

De casussen werden ingedeeld in verschillende moeilijkheidsgraden, met de nadruk op Niveau 2 (Gemiddeld) & Niveau 3 (matig complex) scenario's. Deze omvatten situaties met aangifte in meerdere staten, HSA-activiteiten, inkomsten uit formulier C, vermogenswinsten, ACA-rapportage, buitenlandse rekeningen en belastinglogica op basis van K-1-formulieren.

Kwaliteitsborging en acceptatiecontroles

Shaip stemde de levering af op strikte kwaliteitseisen met betrekking tot logische consistentie, toewijzing van belastingvelden, volledigheid van documenten, structurele conformiteit met Amerikaanse belastingsjablonen en gereedheid voor de uiteindelijke audit. De workflow hield ook rekening met afwijzingscriteria voor onjuiste PDF's, ontbrekende financiële gegevens, dubbele datasets en onjuiste plaatsing van velden.

Privacy en naleving

Alle gegevens waren ontworpen om synthetisch of correct geanonimiseerd te zijn, zonder echte persoonsgegevens en met een meerstaps anonimiseringsproces. Dit garandeerde dat de dataset kon voldoen aan de testbehoeften van de organisatie, met behoud van de privacyregels.

Omvang van de dataset voor synthetische belastingen

Datasetcomponent strekking
Kastvolume 2,000 gevallen
Schaalbaarheid Uitbreidbaar tot 5,000 kisten
Aardrijkskunde Californië, Texas, New York, Illinois, Florida
Documenten per zaak 7–15 documenten
Moeilijkheidsgraden Focus op niveau 2 en niveau 3
Federale formulieren 1040, Bijlagen 1–3, A, B, C, D, E, SE en toepasselijke formulieren
Staatsformulieren Relevante aangifteformulieren, schema's, tegoeden en bewijsstukken van de overheid.
Samenvattende uitvoer Overzicht van federale en staatsbelastingen
Leveringsformaat Alleen PDF
Wekelijkse doorvoer 300–400 datasets

Resultaat: Evaluatiegegevensset voor bedrijfsgeschikte AI voor belastingaangiften

  • Een raamwerk gecreëerd voor 2,000 hoogwaardige belastingzaken Ontworpen voor interne evaluatie en testen.
  • De operationele gereedheid voor het opschalen van de productie is vastgesteld. 5,000 gevallen
  • Maakte realistische modeltests mogelijk voor alle belastingworkflows van de federale overheid en vijf staten.
  • Elk dossier is zo gestructureerd dat het de daadwerkelijke werkwijze van een registeraccountant weerspiegelt, inclusief intake, documentatie, archivering en samenvatting.
  • Strikte controles ingebouwd voor anonimisering, afstemming, volledigheid en PDF-opmaak.

Al met al laat deze samenwerking zien hoe Shaip teams die zich bezighouden met AI voor belastingzaken kan helpen om verder te gaan dan generieke voorbeelden en over te stappen op evaluatiegegevenssets van bedrijfsniveau die de werkelijke complexiteit van aangiften, redeneringen over meerdere documenten en jurisdictiespecifiek belastinggedrag weerspiegelen. Het resultaat is een sterkere basis voor modelbenchmarking, kwaliteitsborging en interne productvalidatie.

Citaat icoon

Shaip bracht structuur, nauwkeurigheid en schaalbaarheid aan in een zeer complex initiatief voor belastinggegevens. Hun vermogen om complexe federale en staatsaangiftevereisten te vertalen naar realistische, geharmoniseerde casusdatasets creëerde een sterke basis voor onze AI-evaluatieworkflows.

— Hoofd van de AI-oplossingen voor belastingen

★ ★ ★ ★ ★
Citaat icoon